{"as_of":"2026-08-19T19:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57ebfaeac60eccca02b42a9ba9ad3d55112b3d4ab971f99d658ed0d763aca350","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:33:19.063498Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T16:18:01.560780Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2410.18451"},"observation_digest":"sha256:502fd3e607387e02146775560aa0ae2df2e876855bd0ab7d963d4674f16858af","observation_id":"d655d4cf-9b93-415e-84c2-e0a144d85aaf","resolution":{"observed_at":"2026-05-17T16:18:01.675521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-12T17:33:35.420485Z","title":"Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12449","last_updated":"2024-11-20T10:06:05Z","snapshot_observed_at":"2026-08-18T20:32:47.990213Z","submitted_at":"2024-11-19T12:17:43Z","title":"Neon: News Entity-Interaction Extraction for Enhanced Question Answering","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:33:35.420485Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2411.12449"},"observation_digest":"sha256:62b11b2672f1a46785db250c7ed50c54f383c7a5f9f643a120bbdaf5edbd8090","observation_id":"d561d878-9edc-4688-9068-72a3c8c167bc","resolution":{"observed_at":"2026-08-12T17:33:35.420485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-12T17:15:47.938224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-17T01:00:48.700288Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.938224Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:8ff4c80f3112e2fed4ba9df97e73b712c2ca6590aea6e02a009e4a425cae69a8","observation_id":"5e5792f0-9ebf-48ac-bfaf-dcd252318112","resolution":{"observed_at":"2026-08-12T17:15:47.938224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-12T13:06:27.910817Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16502","last_updated":"2025-02-26T16:46:25Z","snapshot_observed_at":"2026-08-15T20:57:47.162339Z","submitted_at":"2024-11-25T15:37:27Z","title":"Interpreting Language Reward Models via Contrastive Explanations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:06:27.910817Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2411.16502"},"observation_digest":"sha256:ab015254fd0d13257b3d809029c09074d587f72a1e4ec8c647ca34abce72d870","observation_id":"ce12127a-aba2-41c0-aedc-27fc53cc946c","resolution":{"observed_at":"2026-08-12T13:06:27.910817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-12T12:58:30.536214Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16646","last_updated":"2025-02-09T07:53:38Z","snapshot_observed_at":"2026-08-13T05:48:57.895519Z","submitted_at":"2024-11-25T18:28:26Z","title":"Self-Generated Critiques Boost Reward Modeling for Language Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T12:58:30.536214Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2411.16646"},"observation_digest":"sha256:dde3b820ab5a3ec0c320b9fabc883b3a44815f6f6280a8dcb0c9446b168fcab2","observation_id":"5277e0aa-39f4-4e3d-9cdb-0541f6c20deb","resolution":{"observed_at":"2026-08-12T12:58:30.536214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-12T11:03:01.245578Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models.arXiv preprint arXiv:2406.08673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18688","last_updated":"2025-06-14T04:20:06Z","snapshot_observed_at":"2026-08-19T02:50:38.121616Z","submitted_at":"2024-11-27T19:00:10Z","title":"Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T11:03:01.245578Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2411.18688"},"observation_digest":"sha256:e00bb065d9f5db176cad9f07d628af0b815694eb0814722019bad55c4b10e277","observation_id":"d76de97a-a0c9-4a79-9842-f6b9fa669d10","resolution":{"observed_at":"2026-08-12T11:03:01.245578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-12T04:34:12.100832Z","title":"github.io/blog/qwen2.5/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01253","last_updated":"2025-01-22T15:09:58Z","snapshot_observed_at":"2026-08-16T16:50:21.438663Z","submitted_at":"2024-12-02T08:22:56Z","title":"Yi-Lightning Technical Report","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:34:12.100832Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2412.01253"},"observation_digest":"sha256:6c60c78b97a999d87d617f0c0a936cd44171ef96e75c582c7986b539348a635f","observation_id":"5fe5e228-41a1-4b00-8d29-50f13a4701e5","resolution":{"observed_at":"2026-08-12T04:34:12.100832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-11T22:48:22.834763Z","title":"HelpSteer2 : Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-19T17:06:18.927542Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.834763Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:a7994e3ecdb218b7fdab22bdf94a1caf2adee9f73f45e2a95905e21ce482be63","observation_id":"b8c57ab6-079c-48fc-8754-5faf0619f4f0","resolution":{"observed_at":"2026-08-11T22:48:22.834763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-11T21:38:06.784896Z","title":"Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04305","last_updated":"2024-12-05T16:26:31Z","snapshot_observed_at":"2026-08-18T12:25:12.231651Z","submitted_at":"2024-12-05T16:26:31Z","title":"ALMA: Alignment with Minimal Annotation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:38:06.784896Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2412.04305"},"observation_digest":"sha256:0c0c7c7dc21d49e4da96fc9b4a6e8e152308c790f99a1768ab13b5a007e84776","observation_id":"8c6e3985-09e4-4046-9f32-5f2eb48742c4","resolution":{"observed_at":"2026-08-11T21:38:06.784896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-10T14:25:13.206994Z","title":"Helpsteer2: Open-source dataset for training top- performing reward models","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2501.15453","last_updated":"2025-01-28T06:35:32Z","snapshot_observed_at":"2026-08-15T19:34:30.287297Z","submitted_at":"2025-01-26T08:49:46Z","title":"Data-adaptive Safety Rules for Training Reward Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:13.206994Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2501.15453"},"observation_digest":"sha256:9ba08e2d4989dd0e3731ea49dcf07db6b284bcbaeb541e0a1125359dd45e4d3d","observation_id":"15725ff4-32ee-4da2-80d6-910a317613ff","resolution":{"observed_at":"2026-08-10T14:25:13.206994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-09T23:02:23.423998Z","title":"J., Sreedhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18578","last_updated":"2025-02-26T18:58:53Z","snapshot_observed_at":"2026-08-17T15:14:37.183066Z","submitted_at":"2025-01-30T18:50:25Z","title":"R.I.P.: Better Models by Survival of the Fittest Prompts","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T23:02:23.423998Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2501.18578"},"observation_digest":"sha256:b90a1607f8f578aa79753e5a69187e7e8c6a58b6ef12ea0c3f56f510bef767b6","observation_id":"19f7cfba-beb8-46ec-a317-a83a09299070","resolution":{"observed_at":"2026-08-09T23:02:23.423998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-08-15T00:53:48.099058Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"reference_index":163,"source":"arxiv_source","source_observed_at":"2026-05-12T15:39:40.845703Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2502.05171"},"observation_digest":"sha256:da73aa6103bd7f53673c504a14c28d64934d58624dad7019e64b093592e7ffc3","observation_id":"6a029ccd-4f98-48ef-9ea0-a947deed1b80","resolution":{"observed_at":"2026-05-12T15:39:41.285505Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-16T12:27:55.152640Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:5d789670723eb7f2db536db1398860204bb1f375157c4198af4ce1d3a7e85bc4","observation_id":"1109fac1-d0c1-485c-ba78-d9ec08f5d82d","resolution":{"observed_at":"2026-05-22T19:32:01.189460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-16T12:33:19.063498Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-16T12:27:55.152640Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":11},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:19.063498Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:545fc9c670a97ba09c36b9a4e7931dfd45166f8c387ad3c12b05e10098b7c017","observation_id":"b6668993-b9bf-45b2-a6e8-98e72e691130","resolution":{"observed_at":"2026-08-16T12:33:19.063498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-15T22:24:50.645175Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models.arXiv preprint arXiv:2406.08673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07263","last_updated":"2025-06-09T11:46:47Z","snapshot_observed_at":"2026-08-18T20:19:08.012548Z","submitted_at":"2025-05-12T06:23:08Z","title":"Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:24:50.645175Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.07263"},"observation_digest":"sha256:412596b906500e32f20ee7fcc441dd640dd2b4f5e2ba6bdd862afc29df146af6","observation_id":"68fd61bc-e436-4825-8baf-73b7ce9743dd","resolution":{"observed_at":"2026-08-15T22:24:50.645175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-15T21:12:52.735907Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.735907Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:7aa83ec75751829bca61dcec6ab99c8ab1bb840984d4d9e44f3f887b3e8841e4","observation_id":"caed08d2-caed-4eec-b14c-a38746b092d5","resolution":{"observed_at":"2026-08-15T21:12:52.735907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-15T21:09:01.271818Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10775","last_updated":"2025-05-16T01:27:03Z","snapshot_observed_at":"2026-08-15T21:01:35.130546Z","submitted_at":"2025-05-16T01:27:03Z","title":"A Systematic Analysis of Base Model Choice for Reward Modeling","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T21:09:01.271818Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.10775"},"observation_digest":"sha256:739fa35340618fd5b8c808a100b1690455382ec0bae403dfb703633b48f37d04","observation_id":"3af45c27-3863-4aec-ab9a-134255b2300e","resolution":{"observed_at":"2026-08-15T21:09:01.271818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-15T20:50:10.696490Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-18T20:01:50.393122Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.696490Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:af9dad8948a601881b0eed78c2cb3c1225bc4327b2e0ee83bb5c4cba7a95ec4e","observation_id":"8f717129-d5ef-4671-9290-c40b8efb86ff","resolution":{"observed_at":"2026-08-15T20:50:10.696490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T12:53:03.339487Z","title":"J., Sreedhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:53:03.339487Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.23363"},"observation_digest":"sha256:bd7a5da33254f80505234a5e10e0b7d01200f7b72cbaddad288d1d051330266f","observation_id":"93f23228-ef50-42f8-802c-ad68b2f37369","resolution":{"observed_at":"2026-08-07T12:53:03.339487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T12:27:50.908285Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.908285Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:8858aae2119718844aa6250ca365e8796ab043d8366dc888958299e0b37cdb1d","observation_id":"e57198dc-bc3b-4e25-9d4e-e0450c9c8766","resolution":{"observed_at":"2026-08-07T12:27:50.908285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2506.01937","last_updated":"2026-04-23T14:42:19Z","snapshot_observed_at":"2026-07-06T21:35:12.872021Z","submitted_at":"2025-06-02T17:54:04Z","title":"RewardBench 2: Advancing Reward Model Evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T11:18:03.965711Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.01937"},"observation_digest":"sha256:99d9bfb48fba497aa5a7fe4504587d058745843b91da3cf7bd99d0f865e118dd","observation_id":"ad03ac79-0afa-486b-b655-aa3c4bee344f","resolution":{"observed_at":"2026-05-19T11:22:16.733814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-15T20:48:01.973467Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.973467Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:2461879c82ef675a6d11001ccb860058618dc139508509bfc8df0185c3a5a1f2","observation_id":"977e5d76-02ea-4199-9eea-5075d5515872","resolution":{"observed_at":"2026-08-15T20:48:01.973467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T00:42:47.880878Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12915","last_updated":"2025-06-15T17:19:19Z","snapshot_observed_at":"2026-08-15T16:59:28.967597Z","submitted_at":"2025-06-15T17:19:19Z","title":"PersonaFeedback: A Large-scale Human-annotated Benchmark For Personalization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:42:47.880878Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.12915"},"observation_digest":"sha256:515e5e00c2513dd2a8df1826ec5ff1bc8782333487a8d03016996092c5ef9982","observation_id":"b3b23bd3-640a-4e84-89ff-091dd43c11d9","resolution":{"observed_at":"2026-08-07T00:42:47.880878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T00:15:33.902602Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models.arXiv preprint arXiv:2406.08673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-17T21:52:48.320143Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.902602Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:3ee11699ab40b80c75ef1b18d0592e2a9a4c1a3e58baf527b1067c4c2228b43e","observation_id":"0eb732b7-d282-465f-b157-e4328d374676","resolution":{"observed_at":"2026-08-07T00:15:33.902602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-15T19:23:55.065209Z","title":"Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16712","last_updated":"2025-06-20T03:10:52Z","snapshot_observed_at":"2026-08-19T01:14:08.902161Z","submitted_at":"2025-06-20T03:10:52Z","title":"ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T19:23:55.065209Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.16712"},"observation_digest":"sha256:b1e9cc62249c37aa8ef73d0935685074a4a83a454b5e202252be85be01f479b8","observation_id":"3b7fe163-9edf-44d3-8b08-d2fcf4f8311e","resolution":{"observed_at":"2026-08-15T19:23:55.065209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-06T22:51:33.947555Z","title":"Zhilin Wang, Yi Dong, Olivier Delalleau, Jiaqi Zeng, Gerald Shen, Daniel Egert, Jimmy J Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20544","last_updated":"2025-06-25T15:37:53Z","snapshot_observed_at":"2026-08-15T19:19:14.685216Z","submitted_at":"2025-06-25T15:37:53Z","title":"When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:51:33.947555Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.20544"},"observation_digest":"sha256:d8619e76c1e46e46016e757f09ca191bc77a25a48cb417dabe2b23b263ca989f","observation_id":"e077090a-7ba5-4c32-8c37-46c2b97c1ef3","resolution":{"observed_at":"2026-08-06T22:51:33.947555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-06T18:11:19.396424Z","title":", author Dong, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09075","last_updated":"2025-07-11T23:35:54Z","snapshot_observed_at":"2026-08-09T12:00:51.451716Z","submitted_at":"2025-07-11T23:35:54Z","title":"OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:11:19.396424Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2507.09075"},"observation_digest":"sha256:71e88b3290ef23f4da87097c0b6434d452964cba2bbf372f0f10ac747d94c185","observation_id":"a415e80b-7a3e-428c-b68d-885bbdbf7a28","resolution":{"observed_at":"2026-08-06T18:11:19.396424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-06T17:48:07.201291Z","title":"J., Sreedhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.201291Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:05bae08fff7e1bca2e404c4f1b80ea58d0c158be59923d7619c42d2ad04bab7b","observation_id":"5be4873b-40e3-45a8-896b-91a648f1633d","resolution":{"observed_at":"2026-08-06T17:48:07.201291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-06T16:58:14.283812Z","title":"J., Sreedhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12584","last_updated":"2025-07-16T19:09:58Z","snapshot_observed_at":"2026-08-13T23:21:01.395427Z","submitted_at":"2025-07-16T19:09:58Z","title":"Second-Order Bounds for [0,1]-Valued Regression via Betting Loss","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:58:14.283812Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2507.12584"},"observation_digest":"sha256:76f3e3b283b5679e384456bb620894cc1c5ba37e0137d8e77e24b6e02b70361a","observation_id":"ab21d6ac-d056-44f4-9ca7-01b06844b234","resolution":{"observed_at":"2026-08-06T16:58:14.283812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T12:27:27.632845Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-17T12:03:39.901876Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.632845Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:bb3a9c0c77365622a64588314f203885af710901e19dc9dc71123ebe908729cf","observation_id":"abf26adc-4c7d-4de0-b06e-55ef50970bdd","resolution":{"observed_at":"2026-08-05T12:27:27.632845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2601.03630","last_updated":"2026-05-14T03:13:06Z","snapshot_observed_at":"2026-08-17T02:45:15.646461Z","submitted_at":"2026-01-07T06:19:26Z","title":"Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T17:18:10.045283Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2601.03630"},"observation_digest":"sha256:660f73badf58fe653c7e70f26c9fbd5cc8a7cb8e7231e069af6992986cf5caad","observation_id":"bc0d8b94-5e21-4b50-841c-5a4a769fafd5","resolution":{"observed_at":"2026-05-16T17:21:07.946949Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2606.13227","last_updated":"2026-08-06T07:22:09Z","snapshot_observed_at":"2026-08-09T23:09:47.165775Z","submitted_at":"2026-06-11T11:41:07Z","title":"PolyAlign: Conditional Human-Distribution Alignment","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-27T06:38:55.992652Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2606.13227"},"observation_digest":"sha256:7f88df04de3057185cfaae4b36ab12aadd57bdf923d485be1134fc735777905e","observation_id":"db8f3726-5db8-4eb9-b9e8-983974304b8c","resolution":{"observed_at":"2026-07-03T15:08:33.613033Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":"2406.08673","doi":"10.48550/arxiv.2406.08673","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","venue":"arXiv (Cornell University)","work_id":"a48d5ada-8623-467d-baf4-93bd47703121","year":2024},"citing_paper":{"arxiv_id":"2606.27578","last_updated":"2026-06-25T22:09:50Z","snapshot_observed_at":"2026-07-07T00:01:44.678954Z","submitted_at":"2026-06-25T22:09:50Z","title":"PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T01:26:00.228782Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2606.27578"},"observation_digest":"sha256:dbad33a0a765125a0b0da819cfa884288788c454a0c4a3d4980d049b42f9486d","observation_id":"efbb4249-af8a-485e-903b-8c4416d37995","resolution":{"observed_at":"2026-07-01T18:55:58.586206Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-02T02:00:27.655165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14485","last_updated":"2026-07-16T01:58:53Z","snapshot_observed_at":"2026-08-16T12:18:51.533898Z","submitted_at":"2026-07-16T01:58:53Z","title":"Step-Level Preference Learning for Generative Agents in Social Simulations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T02:00:27.655165Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2607.14485"},"observation_digest":"sha256:126fade18dd693977f3965e9b82470813a911e6405447d4eaa8ad176a71fb9a3","observation_id":"26726097-ee01-4fec-bbb3-dc053c65c315","resolution":{"observed_at":"2026-08-02T02:00:27.655165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-07-31T00:30:21.547440Z","title":"Helpsteer2: Open-source dataset for training top- performing reward models.arXiv preprint arXiv:2406.08673,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25136","last_updated":"2026-07-27T23:05:12Z","snapshot_observed_at":"2026-08-16T02:33:17.817541Z","submitted_at":"2026-07-27T23:05:12Z","title":"Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T00:30:21.547440Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2607.25136"},"observation_digest":"sha256:3c623221a1781f43da5e92f36717c6f27351ea708d6636b1bf2eefb5949ae5b9","observation_id":"ff47f6f4-94a1-4420-ae85-74801ece0ce2","resolution":{"observed_at":"2026-07-31T00:30:21.547440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.08673/citation-record","integrity":"/paper/2406.08673/integrity","json":"/paper/2406.08673/citation-record.json","paper":"/paper/2406.08673"},"outbound":[],"paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2406.08673."}