{"as_of":"2026-08-15T10:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0df22cf51ac69b79d31c25b37b6aeb0a48cffa08220fafc44ffbd70b066627ef","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:15:47.969050Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12843/citation-record","integrity":"/paper/2411.12843/integrity","json":"/paper/2411.12843/citation-record.json","paper":"/paper/2411.12843"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.761360Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.761360Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:bb1c0a8dd4bf8524e8d70bc00e0c7fe8275f165998a64ce4e4caf765754ef65b","observation_id":"4e161b2c-34e3-4133-a110-a5e585e1f317","resolution":{"observed_at":"2026-08-12T17:15:47.761360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.767020Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.767020Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:c6d55600d5468f303feffd19f5676ac4da5720242d3a474d860dd33b21e498c2","observation_id":"a25c7f74-9667-4f33-b6fb-4c84c54ce535","resolution":{"observed_at":"2026-08-12T17:15:47.767020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.566694Z","title":null,"venue":null,"work_id":"dcc2071c-97f3-45c0-81f4-f29f46132dff","year":2011},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.771511Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:5ad5a355f9b3497defb1567253c977def3293337b37f763ea8c6cca340ca1088","observation_id":"081e54fb-3acf-418c-be61-60cf8a58c732","resolution":{"observed_at":"2026-08-12T17:15:48.570039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-08-14T16:32:16.325631Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-12T17:15:47.775855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.775855Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:e2c2e4c19069afef8322b978ffdfc72c988e150ae0479282489289bbae505b0e","observation_id":"3691b473-c2fe-40e0-9867-c3f02393bc96","resolution":{"observed_at":"2026-08-12T17:15:47.775855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-12T17:15:47.780377Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.780377Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:d234c423c382ceb950d4a7acd54c51d36bb660a6a527f9d11db201d6330da2c1","observation_id":"ec021049-0eab-49c7-b308-445dbea10f05","resolution":{"observed_at":"2026-08-12T17:15:47.780377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.557874Z","title":null,"venue":null,"work_id":"d51c3b9c-723d-4178-b745-d540e47968cb","year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.784982Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:09d8e296cacaa772add6168b6dc2b396f80384534c2bf08bc3e1e3f70db6267e","observation_id":"bf53b892-14f2-425c-a9a3-ab687e1ea5ec","resolution":{"observed_at":"2026-08-12T17:15:48.560838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.547756Z","title":null,"venue":null,"work_id":"d1104eb9-5c68-4142-ba01-931d2debf213","year":2014},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.788433Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:529993032de81d4f55bc7809e0e6be212483f71f9f20aff75bfea11847aaeb3a","observation_id":"b6c3f1fc-d1d5-437e-89cb-e94123dd7724","resolution":{"observed_at":"2026-08-12T17:15:48.551619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T17:15:47.793228Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.793228Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:82a2e3638fae51f55e392f3eb71748756de02a0cc78380823ff6798b9e94e2db","observation_id":"40253885-eda4-42bb-897d-6536a1eb4854","resolution":{"observed_at":"2026-08-12T17:15:47.793228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.797841Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.797841Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:a4d6209cb77f40e1b5685d83390438cedc5cc464bb4a54b992fffa826f8dba5c","observation_id":"6d254da8-a3c7-41f1-97e3-76f4752b190d","resolution":{"observed_at":"2026-08-12T17:15:47.797841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.531545Z","title":null,"venue":null,"work_id":"9d17d14f-630e-4058-91e3-b8a5ceba5b3c","year":2006},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.801861Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:b29bdf930aa2bb26a4e01be46ea4f6917fcd8c135c30b5b85815f03e68ebea43","observation_id":"2ef17b6b-f8b7-4189-ab8b-30825ccca466","resolution":{"observed_at":"2026-08-12T17:15:48.535395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-08-15T03:25:32.357214Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-12T17:15:47.805929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.805929Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:e971bb8c1712878921793b0aaa93f034374214f2b5e76dbb1ad2a96a79847896","observation_id":"3d06af9e-fbb3-4650-ac11-200bed482f14","resolution":{"observed_at":"2026-08-12T17:15:47.805929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.810658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.810658Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:c28b7a10f849526a4521532578f261c888ab11b36d17ec9e19ac1116db821f32","observation_id":"70a8b507-2a26-45ac-9373-33f3a7df35a0","resolution":{"observed_at":"2026-08-12T17:15:47.810658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.519733Z","title":"u rnkranz, Eyke H \\","venue":null,"work_id":"bb93f594-e67c-4227-a1fc-d84937bff11c","year":2011},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.814466Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:652fe0a30127d38478877e424d307b1880946f6b14ca83ae05368cc745107a86","observation_id":"d935d9db-872b-4b7f-96cc-af7637e00f58","resolution":{"observed_at":"2026-08-12T17:15:48.523675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01752","last_updated":"2020-01-15T07:19:09Z","snapshot_observed_at":"2026-08-14T16:09:14.985650Z","submitted_at":"2019-07-03T06:15:14Z","title":"On the Weaknesses of Reinforcement Learning for Neural Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01752","snapshot_observed_at":"2026-08-12T17:15:47.818566Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.818566Z"},"links":{"cited_paper":"/paper/1907.01752","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:7b3181868f5d9c82874838c2719a1eecdfee17c7569e906fcf40de9e8197b310","observation_id":"1a394c47-48e2-4352-b8af-e43e3388513e","resolution":{"observed_at":"2026-08-12T17:15:47.818566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.509294Z","title":null,"venue":null,"work_id":"e70b2e0c-7fe5-4f34-8dde-cf8ad5bb25d5","year":2017},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.823139Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:b12b0f033a60a4ea38e7b632bb4c82c87dfa3093b54830d657d2c09e34bf76e4","observation_id":"152af994-d48c-4e32-975f-2259477455ae","resolution":{"observed_at":"2026-08-12T17:15:48.512901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-12T17:15:47.827057Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.827057Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:64fef5dd705dbcc3cd5c547ca7ddc39e3b2e9f7073b1c91966c6899d6be77fa8","observation_id":"b4e678f4-cd4b-47b1-be74-b7f539c50a42","resolution":{"observed_at":"2026-08-12T17:15:47.827057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.499358Z","title":null,"venue":null,"work_id":"10f58ccd-da75-4425-82aa-c89909d10df5","year":1970},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.831232Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:2b411f58443a3a4f29e05c0ec2892c010b99ae993a1baf59a9ea050eefacb4f6","observation_id":"c3dc8528-77f9-4e5b-b3b4-fd185d323166","resolution":{"observed_at":"2026-08-12T17:15:48.502602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-12T17:15:47.835813Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.835813Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:6ea2299c587416932359cbc1b969bac213a0e4e9c51e96d59ba94fa57169fcf1","observation_id":"b83db4eb-5179-401b-a927-dd8a7d208015","resolution":{"observed_at":"2026-08-12T17:15:47.835813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02054","last_updated":"2024-02-04T10:48:30Z","snapshot_observed_at":"2026-08-13T05:58:26.330217Z","submitted_at":"2023-10-03T13:53:08Z","title":"AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02054","snapshot_observed_at":"2026-08-12T17:15:47.840044Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.840044Z"},"links":{"cited_paper":"/paper/2310.02054","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:4de5ca7f4abc86528005a6d69452151c93c1ba2cc115c2167867a962a50fafaf","observation_id":"d77b52b3-ffcf-4168-ada9-63c5d20a9e18","resolution":{"observed_at":"2026-08-12T17:15:47.840044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-12T17:15:47.848222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.848222Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:c3eb8bffcada871d3f8ce8f4d8928f3bcf01fcc38c579af0446012cdabdc0fcf","observation_id":"3af6c8b8-c15d-43ce-8191-56798173b0c4","resolution":{"observed_at":"2026-08-12T17:15:47.848222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.852311Z","title":null,"venue":null,"work_id":null,"year":1949},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.852311Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:37b6e12ab23d717a17785775ead277e4b800020a5e73a84240257f9014a32438","observation_id":"b902db48-cb28-4ae0-84b9-70ae807cc43f","resolution":{"observed_at":"2026-08-12T17:15:47.852311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T17:15:47.856138Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.856138Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:522eb2b392bc4ecbfb40289ebb154115a8f6372095f47efe714cfeee91d73301","observation_id":"940f65f2-140c-471d-b43c-2e6c68a55b92","resolution":{"observed_at":"2026-08-12T17:15:47.856138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-12T17:15:47.859637Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.859637Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:5442c458f8437e9afa405f6744ce24612b905676982582b0440843470f4b1926","observation_id":"9a96e8ad-c492-4abe-bda4-17336cf459b9","resolution":{"observed_at":"2026-08-12T17:15:47.859637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.863766Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.863766Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:e917a1967ec73f14b97a5e7862658e09bd64cbdf46639f7f94e1f9dbd7728122","observation_id":"2561aac9-bb22-4ecd-b954-2056a00fcb8d","resolution":{"observed_at":"2026-08-12T17:15:47.863766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.488487Z","title":"Smith, Hannaneh Hajishirzi","venue":null,"work_id":"9ade0a62-f84a-4d5b-891e-9f9c48301316","year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.867933Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:13f9e5e20753d7913093d7e9e30688ff55a022dad5020a65dafb87679b22dac0","observation_id":"940af647-dbf0-44da-84ef-cbae7ac48c00","resolution":{"observed_at":"2026-08-12T17:15:48.492158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-12T17:15:47.872874Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.872874Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:49815b9f129ed966ed0d7ff36fbdaf889cb7897ac1038af015668e0da35d6cd7","observation_id":"5ff87c1e-2a71-461b-9b7c-9b5836edc896","resolution":{"observed_at":"2026-08-12T17:15:47.872874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05328","last_updated":"2024-10-05T21:02:57Z","snapshot_observed_at":"2026-08-12T22:29:59.312295Z","submitted_at":"2024-10-05T21:02:57Z","title":"Reward Learning From Preference With Ties","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05328","snapshot_observed_at":"2026-08-12T17:15:47.876946Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.876946Z"},"links":{"cited_paper":"/paper/2410.05328","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:5a5ea21c29656e1e6a5d26b15af67538fca92104e292b5f13c0bd139733cd9cf","observation_id":"92c73e22-97ef-45f7-855b-f8d2ae6cf105","resolution":{"observed_at":"2026-08-12T17:15:47.876946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-14T00:30:37.594981Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-12T17:15:47.880969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.880969Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:b877473df2a2aff0523b2d2dc0466a156739c101e5826232ea8c1db3f6d4720f","observation_id":"0bb642c8-3734-47cb-8b39-7bd02e952bdb","resolution":{"observed_at":"2026-08-12T17:15:47.880969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-14T22:06:49.895133Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-12T17:15:47.885158Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.885158Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:6d7b73583e3892faea9ec99e4d312f58513afc5afb0a3ec9ed8b3df65d9c6849","observation_id":"c5b7fa9b-491e-42b9-b450-131bf43bd4af","resolution":{"observed_at":"2026-08-12T17:15:47.885158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T17:15:47.889376Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.889376Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:ff1ea3b5cbb101bc78b86880721b5cd1d56f2f2ad5d35eb723110c7b583d8d36","observation_id":"87abdf8f-3f4b-4d97-bd42-e8bc9a804c22","resolution":{"observed_at":"2026-08-12T17:15:47.889376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.478129Z","title":null,"venue":null,"work_id":"2cefb758-2b2a-4789-a8fb-24a1a85afcdc","year":2019},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.893254Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:6a47d8703bc3f249fc8eac646f0348be2c5224e684bffc631e727cbf8691d8a3","observation_id":"93e065f2-3805-4137-a6b4-2d950aae6d9a","resolution":{"observed_at":"2026-08-12T17:15:48.481699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.898069Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.898069Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:a5f159222b897d83bc9349e428b8b7b5ada1977eb6ac358b4fea1e575b79608d","observation_id":"d7f4663a-1ec0-45f7-b058-b44373011881","resolution":{"observed_at":"2026-08-12T17:15:47.898069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.461467Z","title":null,"venue":null,"work_id":"5e447718-087a-4145-8abe-f2df1e86c3a5","year":2019},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.902599Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:968038dcfc4b25da89837b83de6edc927c3574d6974e5f8deba4c042694aa7c8","observation_id":"6c9964f0-f602-4602-9447-f84738a543bf","resolution":{"observed_at":"2026-08-12T17:15:48.464869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.905917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.905917Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:e995836639d59137ae3107dd4dca16c4236e644342e05e6691a9ab29253a80c8","observation_id":"68a67b04-bd87-4310-8196-92aa9276446d","resolution":{"observed_at":"2026-08-12T17:15:47.905917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.444930Z","title":null,"venue":null,"work_id":"e2b1158f-be42-4375-b796-8a51b0378849","year":1967},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.909873Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:11b5297ade389696a23900fe4d8bd3074ab0ca8b73ac7a6290aab1a7c495ca06","observation_id":"a5988650-d0e3-4e86-b80f-e694e68a69ba","resolution":{"observed_at":"2026-08-12T17:15:48.448474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.434919Z","title":null,"venue":null,"work_id":"fe3f702a-51e9-441a-ab20-d8b34ee2f89c","year":2004},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.913664Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:9b54b0b8121f6d914daa9bfcbd85683347ab1ba92f58074b88a86ad72fab1f45","observation_id":"d3072f0c-8627-4e49-a563-cc20e1536aff","resolution":{"observed_at":"2026-08-12T17:15:48.438091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.424677Z","title":null,"venue":null,"work_id":"7f32bcef-1c58-4dee-bad5-6047e0cb485a","year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.917263Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:6c0b11a570f6e3ddfbcd882d122f0cf8ff247780b9145efb5ea82b3f8ee87cc9","observation_id":"b0922306-e35a-4b56-a400-cf09f76f5d87","resolution":{"observed_at":"2026-08-12T17:15:48.428510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-12T17:15:47.921096Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.921096Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:b750ff11888d26cf7456aac67f00628d15bff575ff49ff70d48a78526c272932","observation_id":"3f8bd9b5-5eb3-496b-a319-81820c7e1d00","resolution":{"observed_at":"2026-08-12T17:15:47.921096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-13T10:03:21.044750Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-12T17:15:47.925208Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.925208Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:7d955d90600f429c33df4f63d55fae4cbb004af00320e4fa6ea110e3bab43159","observation_id":"250473cb-99de-4577-8adf-89c68256c17d","resolution":{"observed_at":"2026-08-12T17:15:47.925208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18571","last_updated":"2024-03-06T08:07:02Z","snapshot_observed_at":"2026-08-13T04:07:57.691711Z","submitted_at":"2024-02-28T18:58:25Z","title":"Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18571","snapshot_observed_at":"2026-08-12T17:15:47.929415Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.929415Z"},"links":{"cited_paper":"/paper/2402.18571","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:d657dd2a9bfa311c703d37229c2df24b2114ef087af21e9588d79cace5220978","observation_id":"0c1c3830-a08e-4dee-aea8-068e398d2bfe","resolution":{"observed_at":"2026-08-12T17:15:47.929415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-08-12T23:39:50.330661Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-08-12T17:15:47.933909Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.933909Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:d3b105d36924476ad5ea4139f2e451357559c8c759d78b570164c2b3f04d8b51","observation_id":"6586546e-2a46-48dc-8144-e1e528e25074","resolution":{"observed_at":"2026-08-12T17:15:47.933909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-12T23:44:06.669155Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-12T17:15:47.938224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.938224Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:0e98d6fc1b89c2cab95fdcc6e39dcd6bc2c8edaf3c0701a7f27f2d622a019533","observation_id":"5e5792f0-9ebf-48ac-bfaf-dcd252318112","resolution":{"observed_at":"2026-08-12T17:15:47.938224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-08-15T00:44:06.600935Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-12T17:15:47.942379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.942379Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:af2dd8d4f8cdbe569c2117b9b16f81ae82a1dafa0fad9d8a977fe8d9db33668f","observation_id":"2cb5f4f7-c7cd-4489-a6f2-2162d6cc3936","resolution":{"observed_at":"2026-08-12T17:15:47.942379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.414271Z","title":null,"venue":null,"work_id":"652a7b34-9da6-47ad-8f30-bbf2128004a3","year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.946180Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:f7f9771dc5390e9cb5827660654806a3757004c6efcbe0bbace427bfcbb4886c","observation_id":"74005b54-252c-498a-b0b3-0efe579b79e0","resolution":{"observed_at":"2026-08-12T17:15:48.417739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.402654Z","title":null,"venue":null,"work_id":"6fe20e7e-7406-4929-8efa-ed255d5ce162","year":2020},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.950140Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:be7e99ec384cf0558d931cb9bc566360af1ee2964dbd31a1546e91f4c87bd5e6","observation_id":"eec568d8-294d-4e6f-ab4a-d7e74b41319c","resolution":{"observed_at":"2026-08-12T17:15:48.406353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.388390Z","title":null,"venue":null,"work_id":"734289a1-92bc-49ba-afa0-c9a769f5f218","year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.954036Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:eca201b0b09460d0fe81ae49cef2136579ca06b80e050dd12e1b53112a571a5f","observation_id":"14559811-d16a-449b-a098-a619feddcf6f","resolution":{"observed_at":"2026-08-12T17:15:48.394128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-14T11:44:20.607461Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-12T17:15:47.958038Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.958038Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:6bbe6f26d714754843795bbb9434a524766db38b67482c496b133e70dee8ff61","observation_id":"ba846ef6-2e07-4e29-a80a-bb825c1e5a78","resolution":{"observed_at":"2026-08-12T17:15:47.958038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-14T18:51:06.334767Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-12T17:15:47.961445Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.961445Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:0ed1e511b9aa7003a65d95ca0d93e381637e0f4b934c11e34227b699d7497c5e","observation_id":"9a74b634-c129-40ca-b1e4-d533e99c7df5","resolution":{"observed_at":"2026-08-12T17:15:47.961445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.00650","last_updated":"2021-02-01T05:53:04Z","snapshot_observed_at":"2026-08-13T20:22:10.729923Z","submitted_at":"2021-02-01T05:53:04Z","title":"Rethinking Soft Labels for Knowledge Distillation: A Bias-Variance Tradeoff Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.00650","snapshot_observed_at":"2026-08-12T17:15:47.965644Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.965644Z"},"links":{"cited_paper":"/paper/2102.00650","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:53a08c71d501ff9f256bd91010bd307635bd3d6786e5af7f93c545af28a3927b","observation_id":"b4cbc0b9-fd3d-459d-8dee-dc44595f53ad","resolution":{"observed_at":"2026-08-12T17:15:47.965644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-15T10:46:42.452851Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-12T17:15:47.969050Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.969050Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:9a8f4b7eba21164bb04d546a64a3a012e4607073b4f14208cda82b6908f8b33d","observation_id":"9af073f4-65d2-49b9-b1f3-9963811425cb","resolution":{"observed_at":"2026-08-12T17:15:47.969050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T05:53:27.233333Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2411.12843."}