{"as_of":"2026-08-15T19:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92ebc7a87f8021ea24654ef59d2d28b613788d55c94197d8cf38b2dbc70d3d89","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:53:04.281553Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:59:12.070055Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:28:44.589552Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"cited_work":{"arxiv_id":"2505.23363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23363","snapshot_observed_at":"2026-07-03T17:28:44.589552Z","title":"Discriminative policy optimization for token-level reward models.arXiv preprint arXiv:2505.23363, 2025","venue":null,"work_id":"a1495476-2a02-4410-afa0-f0e2c2837eb8","year":2025},"citing_paper":{"arxiv_id":"2606.15893","last_updated":"2026-06-22T03:05:35Z","snapshot_observed_at":"2026-08-04T09:50:38.097939Z","submitted_at":"2026-06-14T16:25:59Z","title":"BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T04:07:26.224919Z"},"links":{"cited_paper":"/paper/2505.23363","citing_paper":"/paper/2606.15893"},"observation_digest":"sha256:c30bed7d92c7a1c6dae60b9fb43eb638e342fb0f4ec970a9e904a4f291032c31","observation_id":"64672a6b-4d2b-4641-bb7a-29a6eee19258","resolution":{"observed_at":"2026-07-03T17:28:44.591020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23363","snapshot_observed_at":"2026-08-11T14:59:12.070055Z","title":"Bootstrapping language models with DPO implicit rewards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-15T13:46:37.076299Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.070055Z"},"links":{"cited_paper":"/paper/2505.23363","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:92d44a818ada470a433def28d6e9144416ec049e534ede3a5d2cb44a9948b377","observation_id":"959f098a-23bb-411c-9ad1-170ba632a6f2","resolution":{"observed_at":"2026-08-11T14:59:12.070055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23363/citation-record","integrity":"/paper/2505.23363/integrity","json":"/paper/2505.23363/citation-record.json","paper":"/paper/2505.23363"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:00.170010Z","title":"Back to basics: Revisiting REINFORCE -style optimization for learning from human feedback in LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:00.170010Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:b749f5fb6647c784b86bd9cdb60e5adc5b452bd3b53e077ef2c189c3739851d9","observation_id":"b7e148b4-963c-40be-a943-e8a2fed01237","resolution":{"observed_at":"2026-08-07T12:53:00.170010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:00.223597Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:00.223597Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:e891bfe42f45f91b8fef5aa03e4cb70e9217219935d276439625cdbb7d0c1044","observation_id":"0c568d27-ee89-4730-a83b-59ff45722b99","resolution":{"observed_at":"2026-08-07T12:53:00.223597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-07T12:53:00.308256Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:00.308256Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:7598cacd0b7972bc1e5f392e095639aeb903566d339c9cc1836bb77e82b85dfe","observation_id":"47d90448-4963-40a1-833c-85fc9c28b0a5","resolution":{"observed_at":"2026-08-07T12:53:00.308256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:06.604277Z","title":"J., Sun, H., Holt, S., and Van Der Schaar, M","venue":null,"work_id":"520030f5-c063-406d-855d-04306145295b","year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:00.382055Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:5131a865ce11e6aac63bfd1ce3231615a09f21b08e912094ef260956e719edfb","observation_id":"e671e9a0-ca6e-4148-a433-b62f4c7b745d","resolution":{"observed_at":"2026-08-07T12:53:06.731373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:53:00.499583Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:00.499583Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:283afe970bdd48c855547c31b0309206995683dd15b162c8e0b4f22b7ddf07e7","observation_id":"6ba23d50-d678-4642-91c7-7ec6c4b59821","resolution":{"observed_at":"2026-08-07T12:53:00.499583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:06.352708Z","title":"ULTRAFEEDBACK : Boosting language models with scaled AI feedback","venue":null,"work_id":"103f6d29-21aa-4f2b-9ae0-611436825cc5","year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:00.571204Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:c50cbbf418a27fdb4dd13c15a9122c6d3376f1c01b06de60dc87946c07fb0fdb","observation_id":"da094103-4f8a-4beb-8fa2-20f6db544879","resolution":{"observed_at":"2026-08-07T12:53:06.462280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:53:00.686329Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:00.686329Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:082bfb21f15c3cee982d7fa8a734aae5eac5c7cdebd0f3621228c009705cb29b","observation_id":"07a6f9bb-ba1a-4091-8c3e-58fca04d9e37","resolution":{"observed_at":"2026-08-07T12:53:00.686329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:06.150774Z","title":"X., Taori, R., Zhang, T., Gulrajani, I., Ba, J., Guestrin, C., Liang, P","venue":null,"work_id":"d9db9d1b-a7a7-446f-954d-183e3d33fd73","year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:00.786266Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:4f13aa157e1dc704f992712d7ebfc7881e7ac0e8650d5a988201bdee8e7ab30d","observation_id":"734fa4d1-f489-4b57-8976-a661bec6c2f0","resolution":{"observed_at":"2026-08-07T12:53:06.197135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:00.869018Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:00.869018Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:4106f68caeaad2af66dce6eb8ce1d6d37c75b9af32c9b3eb8196856f37d10279","observation_id":"111759b4-88e0-4ade-a945-12fa880d79ae","resolution":{"observed_at":"2026-08-07T12:53:00.869018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T12:53:00.940715Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:00.940715Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:532976758de4c4b10108e36ed6e97cc800ef589fcc76191da15b5073e33680d3","observation_id":"f02d4b2e-4849-4d69-bd77-6a3da47ce89c","resolution":{"observed_at":"2026-08-07T12:53:00.940715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:01.029667Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:01.029667Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:a1d91b9282fd4b6dec33b49b852183ef890b3d89be901d3861420b8e2f64f001","observation_id":"2685d004-6370-4d52-9047-1c961b29abff","resolution":{"observed_at":"2026-08-07T12:53:01.029667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:01.108360Z","title":"ORPO : Monolithic preference optimization without reference model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:01.108360Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:f940bf2593df5544298b5295bcf20e1e6e8d0e95f1c10c1f13fab6a2673adec4","observation_id":"0436e1a4-38b4-4bdf-8626-b935f7155199","resolution":{"observed_at":"2026-08-07T12:53:01.108360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:01.244539Z","title":"J., yelong shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:01.244539Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:1a7ba66440a98b478eda89f2f6a16c9f8b0653d4ea82c4ba4fce8f340ecd999a","observation_id":"aee5fa32-c2f2-44f1-a026-c14aa9a32e3a","resolution":{"observed_at":"2026-08-07T12:53:01.244539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-08-13T15:08:13.316080Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-07T12:53:01.360490Z","title":"O1 replication journey--part 2: Surpassing o1-preview through simple distillation, big progress or bitter lesson? arXiv preprint arXiv:2411.16489, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:01.360490Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:3a54946a039607a7d079d928460bb6cc31fec1c8c88284472c083c09ac45c9fd","observation_id":"4730ea76-6a7a-4f55-a2d8-0e6386a5c80f","resolution":{"observed_at":"2026-08-07T12:53:01.360490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T12:53:01.479481Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:01.479481Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:1046e9c8c3f082e4ac190224e5d8bb4e0c7bfb7e7cb8b60aaf8a65cec9510924","observation_id":"b3209566-044e-4de5-8b0f-5693da8fce9c","resolution":{"observed_at":"2026-08-07T12:53:01.479481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-15T03:01:41.971978Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-07T12:53:01.634524Z","title":"Y., Chandu, K., Dziri, N., Kumar, S., Zick, T., Choi, Y., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:01.634524Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:2c5002a11ce3fdfc4c8aa1924466c37376c1312e9c979d8fcd26206757a42fa8","observation_id":"e0b39bb8-df3e-4cbd-90c0-8bee13c667ef","resolution":{"observed_at":"2026-08-07T12:53:01.634524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:01.756993Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:01.756993Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:13fb86aeb7886d500f09cc334d44de470435b3c372f0fff7526f1e1f3f10dbe1","observation_id":"a18e4999-6eab-447b-abe9-4e904ac4bb1e","resolution":{"observed_at":"2026-08-07T12:53:01.756993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:05.948868Z","title":"Focal loss for dense object detection","venue":null,"work_id":"66bf7c7d-f34b-4706-bd3d-255ac007a9dd","year":2017},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:01.873518Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:743b9281934ecccd054db76d4cd8908bbb7f04f43cc0d4788497848efcf38920","observation_id":"89291a9a-b254-46cb-887d-b3fe6adc8750","resolution":{"observed_at":"2026-08-07T12:53:06.017255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:01.958225Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:01.958225Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:9898601b604e1ae17b88299331f078ad62bf6b4894dab2be90bac99b08b65540","observation_id":"ef3dacc7-bcbf-4059-a2c0-c7a75b53c247","resolution":{"observed_at":"2026-08-07T12:53:01.958225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:05.723305Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":"15013fbc-e0da-4bb3-9ba6-815af686984c","year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:01.963540Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:b7c97dde5e4d8fd6838f09d969f3181626c5bdda42a1d16c36e802148caa37bc","observation_id":"4f0b6d3c-de52-481b-ac72-eb4fa9306ae6","resolution":{"observed_at":"2026-08-07T12:53:05.853693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-08-14T19:09:59.262526Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T12:53:02.050249Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:02.050249Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:da8fe16829fd5a0bbf3d3fdb257b09b491e5aebca568442f48be7a06ac481730","observation_id":"214dbf5c-601e-4e4b-91e4-491fe735d9e0","resolution":{"observed_at":"2026-08-07T12:53:02.050249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:05.534104Z","title":"Introducing OpenAI o1 , 2024","venue":null,"work_id":"d9043340-1b56-4cda-8405-f5346f4f61b8","year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:02.123565Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:ce4dc812c6b19b0760070e2fa40cb00bab5b6d6349a0d736b5eb4344032faaea","observation_id":"c524e7a1-7f5c-4e45-a482-a2f202171da8","resolution":{"observed_at":"2026-08-07T12:53:05.616125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-08-14T11:57:04.446597Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-07T12:53:02.180756Z","title":"O1 replication journey: A strategic progress report--part 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:02.180756Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:5ebe9f4daf74146cec34b86fde5a181fe4ebc2ff56c5500a4709d803d3008c27","observation_id":"2f5a6936-3892-45ca-925a-64d68330879a","resolution":{"observed_at":"2026-08-07T12:53:02.180756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:05.380717Z","title":"From \\ r\\ to \\ q *\\ : Your language model is secretly a q-function","venue":null,"work_id":"71508f27-15e6-4396-a1f5-52152ff2fe90","year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:02.308993Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:ebfb4fe73db3ff9b58c234b81c7880a89738483cdaed5ee271ecd9b451e439ec","observation_id":"b8d82617-0a9f-47b7-87b3-f1362e2cc132","resolution":{"observed_at":"2026-08-07T12:53:05.445722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:02.382625Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:02.382625Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:d99b6a1e8962827e2fb35d2521f234bd5a2c18ac1dfd9ba418462ffaf13e8d11","observation_id":"8ee7fcb0-bfd1-48ce-8c61-cc88102eecec","resolution":{"observed_at":"2026-08-07T12:53:02.382625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:02.451697Z","title":"D., and Arora, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:02.451697Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:113e2c2f89b265e31356b40887dbc83452eb8963749f09135c5dc541b77fd521","observation_id":"5128d80d-a047-4e3d-ae92-b960352d8f3c","resolution":{"observed_at":"2026-08-07T12:53:02.451697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T12:53:02.526618Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:02.526618Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:7d825a670413d0950d3a78a9ac4ff9d5ed54cf03cb99f267338aafcf7dfb1371","observation_id":"36377019-a0e4-4574-8a3e-bbf66a2990f6","resolution":{"observed_at":"2026-08-07T12:53:02.526618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:53:02.679044Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:02.679044Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:6087214bd5f69e916fb218cd9f6e16439aab5bf0828f7356b676479d635674a2","observation_id":"f2781492-3e3f-4302-a97d-0b64e2decd7a","resolution":{"observed_at":"2026-08-07T12:53:02.679044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-07T12:53:02.787047Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:02.787047Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:c4614f088b74f0d075835dca4831f4d3f36e0a96f8d98861ec1af5c43a2c7893","observation_id":"b39d473c-6b70-4b08-8953-e33ab90a1394","resolution":{"observed_at":"2026-08-07T12:53:02.787047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:53:02.872772Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:02.872772Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:9bb104ceb9dffa79bd89e2308ed611f152619f66772961d6190f5c5bb174ced2","observation_id":"a5b5b61b-beb6-46a2-8fd5-9a793fcbb820","resolution":{"observed_at":"2026-08-07T12:53:02.872772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:03.002314Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.002314Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:d28c653df573aa5a8c952ff1a03fd37f5784e7dd5c7ecf20dba177e030416512","observation_id":"f976e7a7-1230-42cc-8514-de3a68daed93","resolution":{"observed_at":"2026-08-07T12:53:03.002314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:53:03.101409Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.101409Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:a3666809cfcef82be3023dc5f48dfb57a0f04a4bbbee89746db6e2b325dc1eeb","observation_id":"1f0c314e-2943-48c8-8d05-f2b3eafab842","resolution":{"observed_at":"2026-08-07T12:53:03.101409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:05.201015Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":"d4a5c4ad-d148-45fa-8f6e-becc89ab05e9","year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.213515Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:68f0ccf51c263d79a4f8b73ec7fbbf9447d72c6bbda56e8c15421de26e2b6227","observation_id":"a17a6c26-1c7b-4fd9-a6f8-f5312e440d53","resolution":{"observed_at":"2026-08-07T12:53:05.258558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-12T23:44:06.669155Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T12:53:03.339487Z","title":"J., Sreedhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.339487Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:dcf4539b68dd0d1361570597becbca5c99510fc024757760c485962146c6b7aa","observation_id":"93f23228-ef50-42f8-802c-ad68b2f37369","resolution":{"observed_at":"2026-08-07T12:53:03.339487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:03.449654Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.449654Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:93cf45cba0330a526236d63712cde81c6ed2c2aa259732e37f119b25867e8034","observation_id":"f9f67d1a-d148-4a31-b69e-96b9941485e9","resolution":{"observed_at":"2026-08-07T12:53:03.449654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:03.557005Z","title":"A., Ostendorf, M., and Hajishirzi, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.557005Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:7b3535e1cc898d0d0c9d3134756dadb8890be2a46d15faa35f344e4dea390e6a","observation_id":"8ac999b2-4ec7-4251-9977-52ee69dabee3","resolution":{"observed_at":"2026-08-07T12:53:03.557005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:53:03.688731Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.688731Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:6d01ab6245f49f265a373a0a70de2346ecff3945b47cd8eaa55c973b090b10eb","observation_id":"2b694f6c-7c0f-42b2-8c8e-1dd3336370c5","resolution":{"observed_at":"2026-08-07T12:53:03.688731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:05.011796Z","title":"Preference-grounded token-level guidance for language model fine-tuning","venue":null,"work_id":"7a9ba7a0-86c4-4674-aee4-90c53639bb54","year":2023},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.798895Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:1945155f498e05089233043786a131e9000375426d7360bc2ef52ecfdd85598b","observation_id":"966c4a33-ee29-426f-9d66-0eab766d6dd0","resolution":{"observed_at":"2026-08-07T12:53:05.104059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-11T23:55:34.185936Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-08-07T12:53:03.880457Z","title":"Free process rewards without process labels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.880457Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:90716c6e711cbffe531a75a18d819c179c3fc694d195de24841ffb1a646b9dcf","observation_id":"902bba15-32bb-41e4-a1ca-dc6fe9861718","resolution":{"observed_at":"2026-08-07T12:53:03.880457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-08-13T12:20:57.788212Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-07T12:53:03.969381Z","title":"Scaling relationship on learning mathematical reasoning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.969381Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:248be2ae82c0aa586378b3b899710b28a7030b12f97180fefa9669f84b8df8df","observation_id":"a76cfcab-45fa-46b7-8a3e-87ae51ec8b98","resolution":{"observed_at":"2026-08-07T12:53:03.969381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:04.818451Z","title":"DPO meets PPO : Reinforced token optimization for RLHF","venue":null,"work_id":"0cde5958-d67d-4ff4-997d-30de7621b1a6","year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:04.065233Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:214d63c0213f7c9ad6ca8e09b860152f667a9ff27a0820039cd266e5cffc5d9a","observation_id":"44ea10ff-3702-4fc1-9508-d064fd29c2be","resolution":{"observed_at":"2026-08-07T12:53:04.908276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:04.169622Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:04.169622Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:2703bd492c3a917713555e49a8f79b26e585d5936adfaca4a50afd1253361af1","observation_id":"815cec98-71d5-46dc-9839-4fb328ba13ca","resolution":{"observed_at":"2026-08-07T12:53:04.169622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:04.281553Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:04.281553Z"},"links":{"citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:e8d53cdc4c7e37bcd1fa74b8f4be06e40f6d7ca79656196d4a23665190c3bbdf","observation_id":"6ebdcbd6-9030-4eb5-8cc6-d3d52ebde259","resolution":{"observed_at":"2026-08-07T12:53:04.281553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 2 inbound Pith citation observations for arXiv:2505.23363."}