{"as_of":"2026-08-18T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ad1471eb92e5a4553dda9f75c859cd3ce9126b352ba2e74d00049bfb2a05e31","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:43:50.639923Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23927/citation-record","integrity":"/paper/2505.23927/integrity","json":"/paper/2505.23927/citation-record.json","paper":"/paper/2505.23927"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:57.265551Z","title":"Analysis of thompson sampling for the multi-armed bandit problem","venue":null,"work_id":"d320cb73-0132-4352-a139-42c28b787eef","year":2012},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.472924Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:13810f6ef601b87a2f90a78471994aeb72fcf6c5447c18f403e0204eb4f4246c","observation_id":"e4249897-9122-4b45-8413-d0da2bfbad51","resolution":{"observed_at":"2026-08-07T12:43:57.353799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:57.113802Z","title":"Thompson sampling for contextual bandits with linear payoffs","venue":null,"work_id":"7c50f02c-ebc8-4d2d-802d-b4fa1dc874c0","year":2013},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.503626Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:b7dbbedc28cc59a2d341b2b4253b62e115bff42448eeff9fa6de42cfbf654acc","observation_id":"20d9d1ba-99c3-4248-8eb1-27b873063592","resolution":{"observed_at":"2026-08-07T12:43:57.169067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.992227Z","title":"Near-optimal regret bounds for thompson sampling.J","venue":null,"work_id":"601861d3-547a-4b39-86e5-332ac1b9ea55","year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.527002Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d75df9a9905ebbc14b3ca969b89ecae4d513bc367405091e7345207161dd5607","observation_id":"123a3047-6d7c-4587-b00f-bc2f1b16ed18","resolution":{"observed_at":"2026-08-07T12:43:57.050843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.883752Z","title":"Preference-based online learning with dueling bandits: a survey.J","venue":null,"work_id":"fc492a7e-1a63-44bd-baf8-c2e96aa9a30f","year":2021},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.557153Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:523360fe8bf6517d5aed036c9a21fd27e1b787d0950b090ae6cee73b763da191","observation_id":"ffa5cb5e-80ae-48f0-a949-f154c1aeaa4c","resolution":{"observed_at":"2026-08-07T12:43:56.921778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.811596Z","title":null,"venue":null,"work_id":"e2676e37-8b31-42b1-b539-a316e0de4c41","year":1952},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.588635Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:9564a15baf41b4a7ca8d80cc1bebd18da0163083b70036b898895454fdc899a9","observation_id":"068d17e4-c7b3-451c-b836-a752a0dd49bd","resolution":{"observed_at":"2026-08-07T12:43:56.839597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-17T11:20:55.974248Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-07T12:43:47.614974Z","title":"Michaud, Jacob Pfau, Dmitrii Krasheninnikov, Xin Chen, Lauro Langosco, Peter Hase, Erdem Bıyık, Anca Dragan, David Krueger, Dorsa Sadigh, and Dylan Hadfield-Menell","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.614974Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:3461fa933c33deff9d65fc94a0b21b55fa6315e94d313951a07057c7b0a36619","observation_id":"1c0b73b2-aa5c-49b1-990e-9906ac6bb7ed","resolution":{"observed_at":"2026-08-07T12:43:47.614974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11140","last_updated":"2022-05-24T02:42:19Z","snapshot_observed_at":"2026-08-16T16:58:28.545612Z","submitted_at":"2022-05-23T09:03:24Z","title":"Human-in-the-loop: Provably Efficient Preference-based Reinforcement Learning with General Function Approximation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11140","snapshot_observed_at":"2026-08-07T12:43:47.660403Z","title":"Human-in-the-loop: Provably Efficient Preference-based Reinforcement Learning with General Function Approximation.arXiv e-prints, page arXiv:2205.11140, May 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.660403Z"},"links":{"cited_paper":"/paper/2205.11140","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:ddbc0152d9b3ac228322346dd3b43fa4de88fa2ff41faa2d9839f773a9744b24","observation_id":"bf60b172-58a5-4b1c-a562-17d5db2b54ab","resolution":{"observed_at":"2026-08-07T12:43:47.660403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01752","last_updated":"2020-01-15T07:19:09Z","snapshot_observed_at":"2026-08-14T16:09:14.985650Z","submitted_at":"2019-07-03T06:15:14Z","title":"On the Weaknesses of Reinforcement Learning for Neural Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01752","snapshot_observed_at":"2026-08-07T12:43:47.697268Z","title":"On the Weaknesses of Reinforcement Learning for Neural Machine Translation.arXiv e-prints, page arXiv:1907.01752, July 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.697268Z"},"links":{"cited_paper":"/paper/1907.01752","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:dbccbacede379702ca5c68a10b42aa682ac36cdab138b7b704c54a604b6638b7","observation_id":"df94777c-9a6c-42ee-a834-a528c133d4c5","resolution":{"observed_at":"2026-08-07T12:43:47.697268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.739631Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":"80b76779-4918-4690-bf6a-8273f5df8816","year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.725692Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:0b5710980d0cc5e108b331c8af2bc4cd1c027d9a290464c6dc747003829fb502","observation_id":"ec97d09e-1422-4c8e-beb9-24e7242a2e90","resolution":{"observed_at":"2026-08-07T12:43:56.773058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.645130Z","title":"RAFT: Reward ranked finetuning for generative foundation model alignment.Transactions on Machine Learning Research, 2023","venue":null,"work_id":"b40d50e6-f490-4a8f-a4c5-83b094045f57","year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.755339Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d343f5eaeedbc581f02127402a4264457b6608d9d161251569096bb7aec6a657","observation_id":"c3b6e898-2535-472e-bb8e-1f0b4efb17ce","resolution":{"observed_at":"2026-08-07T12:43:56.691296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.554661Z","title":"Schapire, Aleksandrs Slivkins, and Masrour Zoghi","venue":null,"work_id":"702b218c-7eca-4e9d-8604-7d698c5cffe9","year":2015},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.799854Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:a0137835b992de4a2190acf9b827a116caec3140edef188f3bb3667e9cf4edaf","observation_id":"9b05ccd0-1758-4e94-898e-5e4cf8905e2f","resolution":{"observed_at":"2026-08-07T12:43:56.598480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-08-17T14:39:44.168275Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-07T12:43:47.833667Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO.arXiv e-prints, page arXiv:2005.12729, May 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.833667Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:2df74b1dfa9b09e491a83c2eb456240b5f18e7e34ffde784dcbc87e7682585f1","observation_id":"19324a54-6076-42a7-9974-d420050cd73f","resolution":{"observed_at":"2026-08-07T12:43:47.833667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.484689Z","title":"Foster and Alexander Rakhlin","venue":null,"work_id":"d1526974-51f6-4628-a722-b178b693a7b0","year":2020},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.872516Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:5661b6bc4b36051d0b4b5dfac5ed43b08a0ff04649473f597f95958fd29c9e19","observation_id":"3b0a6cb4-d055-45c1-963e-d178d68d1d07","resolution":{"observed_at":"2026-08-07T12:43:56.515634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.418217Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"9af1fc1b-7d9b-4222-b549-20e7ed668bdf","year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.899602Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:46c93cba68c331484b648144ad58a98609ada61e6a4a9b50cd97c862e034e129","observation_id":"7e17df10-3712-4376-ba25-69acb9567738","resolution":{"observed_at":"2026-08-07T12:43:56.445967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-16T14:51:01.638500Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-07T12:43:47.923648Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.923648Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:404b15ee213bc2b17597a6c296e9be121bc235a20af64b9819f53d1c4f638015","observation_id":"f93d914f-0c4c-473a-82e8-2c013645e3ae","resolution":{"observed_at":"2026-08-07T12:43:47.923648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-07T12:43:47.949387Z","title":"Reinforced Self-Training (ReST) for Language Modeling.arXiv e-prints, page arXiv:2308.08998, August 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.949387Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:51be037779be91fee053494cd2160ddb4cc2b2885205aea704720c066e93a21b","observation_id":"e83e8437-ccdd-42d5-b84d-f82d4a42da7e","resolution":{"observed_at":"2026-08-07T12:43:47.949387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07841","last_updated":"2021-10-25T19:43:52Z","snapshot_observed_at":"2026-08-16T18:17:09.227857Z","submitted_at":"2021-06-15T02:23:07Z","title":"Randomized Exploration for Reinforcement Learning with General Value Function Approximation","version":2},"cited_work":{"arxiv_id":"2106.07841","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.07841","snapshot_observed_at":"2026-08-07T12:43:51.626586Z","title":"Randomized Exploration for Reinforcement Learning with General Value Function Approximation","venue":"cs.LG","work_id":"9d82ba49-ce4e-440e-b7cf-5e09bed6632a","year":2021},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.982915Z"},"links":{"cited_paper":"/paper/2106.07841","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:316486f75fbd14744990a9e6d826e7880090da7e4bce3d02def4a74817ade7da","observation_id":"577cacf1-c0d0-4a3d-81be-5207f551a71d","resolution":{"observed_at":"2026-08-07T12:43:51.698037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18246","last_updated":"2024-03-18T00:37:12Z","snapshot_observed_at":"2026-08-16T15:28:36.365970Z","submitted_at":"2023-05-29T17:11:28Z","title":"Provable and Practical: Efficient Exploration in Reinforcement Learning via Langevin Monte Carlo","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18246","snapshot_observed_at":"2026-08-07T12:43:48.010070Z","title":"Rupam Mahmood, Doina Precup, Anima Anandkumar, and Kamyar Azizzadenesheli","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.010070Z"},"links":{"cited_paper":"/paper/2305.18246","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:3952c96dd23472ff99cca2dd2341f3e4ddb71ec1f6b4aae57484e15c77c58c93","observation_id":"f297a784-efaf-4ffe-89e3-7dcd0598597c","resolution":{"observed_at":"2026-08-07T12:43:48.010070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.345769Z","title":"Learning trajectory preferences for manipulators via iterative improvement","venue":null,"work_id":"57385f0c-8b5b-45a8-84e7-ee7a50e45cc0","year":2013},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.044855Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:df145241407fbee8ba288db257a06d3b28c39d746b5546efff78b7a2c7232eef","observation_id":"c42b36f4-36c4-48c0-91b7-2a61f39d6dd5","resolution":{"observed_at":"2026-08-07T12:43:56.372101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.245154Z","title":"Schapire","venue":null,"work_id":"47bb33da-f747-4cd1-a088-4dfa5572315e","year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.086054Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:0680537de7c0dcf7f9f1596e5f47bc1527ce604d115895beb065438c364e1d3c","observation_id":"8fcfabfa-f0f1-4928-b963-d64cda7e98fd","resolution":{"observed_at":"2026-08-07T12:43:56.305869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.101299Z","title":"Bellman eluder dimension: new rich classes of rl problems, and sample-efficient algorithms","venue":null,"work_id":"d0850cb4-f3d2-44a4-94de-0b94d212ed53","year":2021},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.220473Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:86a751df87655409eaa4e403c9c7e3353e351c38c4ff8e33bd3386f3002028d8","observation_id":"8d7c2828-6114-47ee-9b1c-75a721be65d2","resolution":{"observed_at":"2026-08-07T12:43:56.160284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02691","last_updated":"2019-12-11T17:33:13Z","snapshot_observed_at":"2026-08-14T16:19:43.723457Z","submitted_at":"2019-06-06T16:35:38Z","title":"An Introduction to Variational Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02691","snapshot_observed_at":"2026-08-07T12:43:48.246384Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.246384Z"},"links":{"cited_paper":"/paper/1906.02691","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:8a99d366c4acb72efc9c7caf0f6329bd29dda2eaba4e5ecdbc5f02fce79c84c6","observation_id":"0c2c094a-4035-4108-932e-73172d5f9e74","resolution":{"observed_at":"2026-08-07T12:43:48.246384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18438","last_updated":"2023-07-03T13:08:46Z","snapshot_observed_at":"2026-08-16T15:28:49.857025Z","submitted_at":"2023-05-29T01:18:39Z","title":"Reinforcement Learning with Human Feedback: Learning Dynamic Choices via Pessimism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18438","snapshot_observed_at":"2026-08-07T12:43:48.277156Z","title":"Reinforcement Learning with Human Feedback: Learning Dynamic Choices via Pessimism.arXiv e-prints, page arXiv:2305.18438, May 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.277156Z"},"links":{"cited_paper":"/paper/2305.18438","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:6a746efc8cc050e410a66b0017802b9c8541379a1122c687609879fa135ed388","observation_id":"42031251-04a4-4d60-98f6-1d92937d10ec","resolution":{"observed_at":"2026-08-07T12:43:48.277156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-08-16T14:51:42.615061Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-07T12:43:48.349648Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.349648Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:ab512f9a24646a43935fdd5f322d32c9edca409600a51de18b712d8283f8aca0","observation_id":"f0776b47-d595-408d-8199-0e20cbb831ad","resolution":{"observed_at":"2026-08-07T12:43:48.349648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-16T15:01:11.681309Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-07T12:43:48.431444Z","title":"Liu, and Jialu Liu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.431444Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:0bc53c77abfeebd62d121de825becdcf2c6e9a7bac38c4a421b675d29c7ea803","observation_id":"5e9a7c7f-6d8b-48bb-a13c-f3dd10c93cb9","resolution":{"observed_at":"2026-08-07T12:43:48.431444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.883047Z","title":"Roberts, Matthew E","venue":null,"work_id":"17b28c78-9205-4737-ae1e-f118d6ca0721","year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.478015Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:57e92e07ecf4cc0d916d8001c393d65a9d427e2690d1943abd02add7e320cee7","observation_id":"2d07115f-7ad9-4934-859e-b3cfd268c94f","resolution":{"observed_at":"2026-08-07T12:43:55.983442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01289","last_updated":"2020-06-29T16:09:49Z","snapshot_observed_at":"2026-08-17T13:48:08.239701Z","submitted_at":"2019-08-04T07:51:36Z","title":"Dueling Posterior Sampling for Preference-Based Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.01289","snapshot_observed_at":"2026-08-07T12:43:48.515394Z","title":"Novoseller, Yanan Sui, Yisong Yue, and Joel W","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.515394Z"},"links":{"cited_paper":"/paper/1908.01289","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:4fa7e9a23278a708fbfc4cf3f473587f5cddc1d9276c5cb28218b9f8fdb2922f","observation_id":"99e536a6-804c-4e8e-9d7d-6a8133fa2060","resolution":{"observed_at":"2026-08-07T12:43:48.515394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:43:48.557964Z","title":"Pong, Tolly Powell, Alethea Power, Boris Power, Elizabeth Proehl, Raul Puri, and Alec Radford","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.557964Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:83dce908e297df014c331ebe148b9d5081916b503456d67ad44c8f20f42565b2","observation_id":"d2dfc404-e7b3-4272-a6ce-8e481e070dfe","resolution":{"observed_at":"2026-08-07T12:43:48.557964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.607303Z","title":"Randomized prior functions for deep reinforcement learning","venue":null,"work_id":"aa4d6ab0-e562-43cb-8acd-d0080f64f784","year":2018},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.595572Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:918f0c7c37c76886bb87cfcf6e06af1402f9a479568190eea65cdc579e3aad29","observation_id":"d119f7ce-7e96-44a5-8ae4-32de28a7a17b","resolution":{"observed_at":"2026-08-07T12:43:55.724220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.341657Z","title":"Approximate thompson sampling via epistemic neural networks","venue":null,"work_id":"45457af3-bdf2-4aeb-9a62-4069327ce757","year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.687662Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:3f475e3fe03c5718933e9d1711481c9b0fc1582e534b8c5342d5aa3349108b7f","observation_id":"49fef49c-a677-43d7-aabc-9d0303095e41","resolution":{"observed_at":"2026-08-07T12:43:55.458395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.239396Z","title":null,"venue":null,"work_id":"0c343eff-74f2-4f7f-810c-b24f3c759ae4","year":2022},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.737226Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:cac5cdcbd7891323f201388cf6deab0a7fa0aaa618bebb93a5e46a1b7fa8c17b","observation_id":"a4149ebe-e20f-44e2-98f4-d8e5ea133972","resolution":{"observed_at":"2026-08-07T12:43:55.265065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T12:43:48.769424Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.769424Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:1faf0324736347029c10548f7cd134974ea6340a7aa366d2ef2f1a09267a931b","observation_id":"6f9f557f-4443-4c58-8032-dc79c85f99d1","resolution":{"observed_at":"2026-08-07T12:43:48.769424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T12:43:48.796716Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.796716Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:43a5ca3ef84057f3eb6056f6e39ae6180e2e4a12a5b73a82356bcb69814d7610","observation_id":"861b40f8-ed0f-40de-9e17-2b78ec60c871","resolution":{"observed_at":"2026-08-07T12:43:48.796716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02870","last_updated":"2019-08-16T22:43:53Z","snapshot_observed_at":"2026-08-14T16:19:30.135815Z","submitted_at":"2019-06-07T02:36:00Z","title":"Worst-Case Regret Bounds for Exploration via Randomized Value Functions","version":3},"cited_work":{"arxiv_id":"1906.02870","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.02870","snapshot_observed_at":"2026-08-07T12:43:51.225927Z","title":"Worst-Case Regret Bounds for Exploration via Randomized Value Functions","venue":"cs.LG","work_id":"8d6f1ee9-dc10-4f41-8838-06371b07b191","year":2019},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.814525Z"},"links":{"cited_paper":"/paper/1906.02870","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:61cc7208e86c18ae4b49f014a7b0580a78109d74736be0cc7608588ea0d061f9","observation_id":"211392fb-78f6-416f-88c2-2596ae83e015","resolution":{"observed_at":"2026-08-07T12:43:51.321069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.160843Z","title":"Learning to optimize via posterior sampling.Math","venue":null,"work_id":"5a638c5e-1740-4061-9b9b-48142035b256","year":2014},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.838269Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:2d99f745b668729f3cc32a39c223811143f146f1d24546f839b63af00fbdef97","observation_id":"55c69687-57ec-4809-8c77-83e041a8c371","resolution":{"observed_at":"2026-08-07T12:43:55.197918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.039512Z","title":"Optimal algorithms for stochastic contextual preference bandits","venue":null,"work_id":"30a31517-bf31-4f40-ba26-5fb221a863e7","year":2021},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.861004Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:55ae84dc89b4f8a117b2ee7a8bb065b13ccde3b2623029fe46ad0994168ed695","observation_id":"bc4131b1-1e3a-4dc0-9db7-ff14eb6c686a","resolution":{"observed_at":"2026-08-07T12:43:55.096880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.652338Z","title":"Efficient and optimal algorithms for contextual dueling bandits under realizability","venue":null,"work_id":"5ab25424-e5a0-4196-bd3c-aebfaf981d3e","year":2022},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.890800Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:244fa7056677c797cd0e524b78d717cf65a49836b75c7e693fc35a2c1650d0bd","observation_id":"d14f95a0-6435-44a0-ad5c-650065971df0","resolution":{"observed_at":"2026-08-07T12:43:54.840829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.235512Z","title":"Dueling rl: Reinforcement learning with trajectory preferences","venue":null,"work_id":"c94a39ce-1345-4b44-8b49-3b77af19cf97","year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.921797Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:637227abfb89892bd84e6de06cf401640f65d94481af0c291b7acf6510278abe","observation_id":"96c7ef00-ab1d-4d6b-afc8-59b1df7108b3","resolution":{"observed_at":"2026-08-07T12:43:54.465692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:43:48.940005Z","title":"Proximal Policy Optimization Algorithms.arXiv e-prints, page arXiv:1707.06347, July 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.940005Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:c64849989366a63d1b8c74d7ee4b120cbf03fc759f72caeca21d830f53a1d913","observation_id":"49191887-b0d3-43ff-95e7-cb122383c61b","resolution":{"observed_at":"2026-08-07T12:43:48.940005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.013352Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":"0aa00424-17b6-4582-933d-b0b4c729472c","year":2020},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.969661Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:ad559c7c04b858044e48be722325e4bc865d41d22e55fdb69f6d5b74210bdf2e","observation_id":"279c74ef-69af-4a5a-80c5-1c6e4b99451a","resolution":{"observed_at":"2026-08-07T12:43:54.117813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.859852Z","title":"Thompson","venue":null,"work_id":"0c9ff017-45ee-4cc2-8ede-f60d1f726d72","year":1933},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.992418Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:f5aec04d20d75f09f2931704df799e3e930ddb40703f2dd306ccde0f308e4861","observation_id":"fa5d1bcb-9c9a-48b3-8d23-0f6bb19a2314","resolution":{"observed_at":"2026-08-07T12:43:53.933023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:43:49.018024Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models.arXiv e-prints, page arXiv:2307.09288, July 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.018024Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:7c0206ecfbf5e99726fd55a4ce977a3f43124d6f088fb56716e4fbf414787619","observation_id":"d0e6e6ee-2a2d-4ea5-9d0c-675fddd8b452","resolution":{"observed_at":"2026-08-07T12:43:49.018024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.753165Z","title":"van de Geer","venue":null,"work_id":"40d4297e-d6c6-4ad3-b13d-aa000dbe2789","year":2000},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.052190Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d96fcc4a75c53fc39f8440ff3449749207255ae86eb41d69f163c268b76e57d1","observation_id":"5ade00be-bf41-4888-ae26-23ff03ca7444","resolution":{"observed_at":"2026-08-07T12:43:53.773838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-16T17:38:24.418331Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-07T12:43:49.083529Z","title":"Beyond Reverse KL: Gen- eralizing Direct Preference Optimization with Diverse Divergence Constraints.arXiv e-prints, page arXiv:2309.16240, September 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.083529Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:8e031fb292351758b9415cf9778e8757a13bb9ba3685941caea8358a5144ae3d","observation_id":"76980b50-eb90-47f5-9a42-dc7bc440db34","resolution":{"observed_at":"2026-08-07T12:43:49.083529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.688475Z","title":"Thompson sampling for combinatorial semi-bandits","venue":null,"work_id":"bf65e9d1-185e-43b2-b0ef-7b7a5c6709b8","year":2018},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.108031Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:c9331f19d88ad0a625a03dea97a7d11abccb6ee4970035050f59cd88e33bd4e8","observation_id":"7f75d0cc-fa25-45bd-bef3-aa7b602e3ef7","resolution":{"observed_at":"2026-08-07T12:43:53.720079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.519666Z","title":"Is rlhf more difficult than standard rl? a theoretical perspective","venue":null,"work_id":"33ff630d-2181-4a34-8c2e-8da7d3c61072","year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.117791Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:683c84602f47ac00cac7555eaa93de1238d2984d946388e6589473648ad6ea42","observation_id":"66e2e15c-29c5-4fef-b039-035424f36808","resolution":{"observed_at":"2026-08-07T12:43:53.586179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.428313Z","title":"A survey of preference-based reinforcement learning methods.Journal of Machine Learning Research, 18(136):1–46, 2017","venue":null,"work_id":"d0de25bc-976b-4888-9c3d-95792db88465","year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.197952Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:6d350cab49defe2d06073d8832b6b01929e06894832065cd1e0a187842fd9100","observation_id":"32e371bb-2530-41ee-91aa-d4f60570624f","resolution":{"observed_at":"2026-08-07T12:43:53.466104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14554","last_updated":"2024-03-12T21:49:59Z","snapshot_observed_at":"2026-08-16T14:49:54.904060Z","submitted_at":"2023-10-23T04:19:35Z","title":"Making RL with Preference-based Feedback Efficient via Randomization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14554","snapshot_observed_at":"2026-08-07T12:43:49.305402Z","title":"Making RL with Preference-based Feedback Efficient via Randomization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.305402Z"},"links":{"cited_paper":"/paper/2310.14554","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:1bc0a3e848c5cd82209c6dc0098f1f72e2b4632d41db3e6d8fc413a386731581","observation_id":"aaaeabf1-1a17-4283-b3f8-afbfa8d4821b","resolution":{"observed_at":"2026-08-07T12:43:49.305402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.198669Z","title":"Borda regret minimization for generalized linear dueling bandits","venue":null,"work_id":"f7c7d237-0255-403b-9507-5c8e431b8a07","year":2024},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.376621Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:aadc4d41ef56060954d7cf6ddcce9a00e4eb06ea6eabc80b2bda93846f80dc3c","observation_id":"3bff1bf3-7f85-42d6-9c5b-5fa3c5a8987b","resolution":{"observed_at":"2026-08-07T12:43:53.309730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-17T14:40:56.015819Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-07T12:43:49.435213Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint.arXiv e-prints, page arXiv:2312.11456, December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.435213Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:e3d9a45bb849c937617f0b7114d6a5a496eb6d34699ac6874846cc139b540143","observation_id":"d633d1f9-2b01-4aa8-929c-e316d7ca4f71","resolution":{"observed_at":"2026-08-07T12:43:49.435213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.070362Z","title":"Near-optimal randomized exploration for tabular markov decision processes","venue":null,"work_id":"c7d01275-407b-49ff-b3f9-91581ab78571","year":2022},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.519282Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:91d6cf8877c7dabd15602ee19d8e6fbd3bb19bf319a091e34fe9a1a9d9438646","observation_id":"50e372fb-8206-41ca-be88-96913864589f","resolution":{"observed_at":"2026-08-07T12:43:53.149868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:52.829155Z","title":"Yang, Aarti Singh, and Artur Dubrawski","venue":null,"work_id":"88f38575-ca7b-42ef-8595-963a2e59ad5c","year":2020},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.630519Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:bc49934386369091a00268bc449d62bb5402c4bdccff240318328abee562a679","observation_id":"358a7f11-bc21-4f36-ae13-e03d2f64e846","resolution":{"observed_at":"2026-08-07T12:43:52.943796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-16T15:41:15.724777Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-07T12:43:49.730231Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears.arXiv e-prints, page arXiv:2304.05302, April 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.730231Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:5076b0efe975e1f350a123c906f2fbac8bd7a53e623cc1f405c5ac753713019b","observation_id":"2224a913-2e3b-4ce0-89b8-bb0c530ca86a","resolution":{"observed_at":"2026-08-07T12:43:49.730231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:52.595662Z","title":"The k-armed dueling bandits problem.Journal of Computer and System Sciences, 78(5):1538–1556, 2012","venue":null,"work_id":"3a20d436-316f-4f4d-9079-2a41d47d6502","year":2012},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.832227Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:633bb1844c7bc7da0b8abd016bd422b6e7013511c99064c8ccd136bc05ef1de5","observation_id":"efdf6433-3dac-4f16-8619-95bc291194bb","resolution":{"observed_at":"2026-08-07T12:43:52.725910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00567","last_updated":"2023-09-08T16:34:55Z","snapshot_observed_at":"2026-08-15T09:05:33.839779Z","submitted_at":"2019-11-01T19:48:57Z","title":"Frequentist Regret Bounds for Randomized Least-Squares Value Iteration","version":7},"cited_work":{"arxiv_id":"1911.00567","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.00567","snapshot_observed_at":"2026-08-07T12:43:50.879889Z","title":"Frequentist Regret Bounds for Randomized Least-Squares Value Iteration","venue":"cs.LG","work_id":"80ea8c66-bfd9-4f87-b27d-3088defc0280","year":2019},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.926426Z"},"links":{"cited_paper":"/paper/1911.00567","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:568efb7268926afc59e57e57928f903c7335cd182d64ab23bb9ac56f24b44eca","observation_id":"74185e95-b077-4d1a-8ed4-77e557bb356e","resolution":{"observed_at":"2026-08-07T12:43:50.963293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-08-16T15:30:19.275550Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-07T12:43:50.030374Z","title":"Lee, and Wen Sun","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.030374Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:fbaccc8aed0415acccd1fbe3ee4551d9b6ca3ee7552c58be9451f7c5e8f2bf13","observation_id":"be121500-6594-443b-9b65-15b395ac386f","resolution":{"observed_at":"2026-08-07T12:43:50.030374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:52.399533Z","title":"Lee, and Wen Sun","venue":null,"work_id":"18b0ae9b-f819-406a-822e-ce13338c2c6a","year":2024},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.138027Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:76256dceb10fb6a8d69f46a8eab50ca0e35f84f9317e2c6caf61da969173eeb5","observation_id":"52573980-9b4b-4c97-91d0-417248f344a7","resolution":{"observed_at":"2026-08-07T12:43:52.502747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-16T15:32:15.390851Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T12:43:50.251391Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.251391Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:85c82317b39b23e5d8bbb3f58e167096fbd49b8fb233eb00bfa1b490e635a6eb","observation_id":"0b8a432e-e368-4c56-b05f-05153a48c8e2","resolution":{"observed_at":"2026-08-07T12:43:50.251391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02231","last_updated":"2023-11-02T22:47:14Z","snapshot_observed_at":"2026-08-16T15:26:50.521869Z","submitted_at":"2023-06-04T01:59:40Z","title":"Fine-Tuning Language Models with Advantage-Induced Policy Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02231","snapshot_observed_at":"2026-08-07T12:43:50.418201Z","title":"Jordan, and Jiantao Jiao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.418201Z"},"links":{"cited_paper":"/paper/2306.02231","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:600606768b04e466c313385b6f20e8cbc22129d0685d9201967cfb8e90034d3c","observation_id":"03c377c5-e3ab-436d-8210-6ccd562be404","resolution":{"observed_at":"2026-08-07T12:43:50.418201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:52.187796Z","title":"Efficient active learning with abstention","venue":null,"work_id":"9cbd0769-243a-4c1c-84f3-2c23ea8bf541","year":null},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.546951Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:b8eadf3866c60ca8ab81c4f365193bbce2c39e57eb12c5c3009c6cc541d85310","observation_id":"77e137d6-8164-40ce-abb3-10a5008f955d","resolution":{"observed_at":"2026-08-07T12:43:52.301764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:51.951757Z","title":null,"venue":null,"work_id":"b319b761-36d5-4657-b61f-8d282a157b1c","year":null},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.639923Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:0b61837a7a5c288a8fd351c1987bd7ac947e1efde31281fdaa91909d0bd8ddb1","observation_id":"b14aa731-9812-46c9-a59b-4c5cdea52644","resolution":{"observed_at":"2026-08-07T12:43:52.029084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T15:43:55.959387Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":3,"verified_fuzzy":31},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.23927."}