{"as_of":"2026-08-10T04:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:90d1eb7a355357ef009059a6659bcb2e075e00a33447030a6321d1d40d291f8d","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:50:45.634287Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23673/citation-record","integrity":"/paper/2505.23673/integrity","json":"/paper/2505.23673/citation-record.json","paper":"/paper/2505.23673"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.878545Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:39.878545Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:b1999046004bf819740a06d868c627179b45d9eaba20cdc0a2599b1217c86695","observation_id":"cbb2eea2-eefa-4813-a6ce-abe16523ff2b","resolution":{"observed_at":"2026-08-07T12:50:39.878545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:56.955294Z","title":"Online learning for linearly parametrized control problems","venue":null,"work_id":"ce0a8575-209e-4b06-b4a0-944e6d16b314","year":2013},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:39.976257Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:4eea913ff197704e6b20111c25d88cde79f75a55fecfaea6f83dedfee278f6d3","observation_id":"f25d9bbb-539f-4ffa-a943-5380cdd1e2ee","resolution":{"observed_at":"2026-08-07T12:50:57.055986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:56.822942Z","title":"Reducing dueling bandits to cardinal bandits","venue":null,"work_id":"448f147b-cb92-494e-9bb0-5ba121ad1ed9","year":2014},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.043920Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:e3a7d85a144d0a1fc5cb0aced5395106d7638dbdcabea88333bcb381bcb8b9b0","observation_id":"f63f9162-3596-4bc2-b4e7-b14c5fb6ed7d","resolution":{"observed_at":"2026-08-07T12:50:56.865663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:40.138320Z","title":"S., Hu, W., Li, Z., Salakhutdinov, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.138320Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:cff83c6700c6f3140b3d90228eeaa6a5a8e6a6c9a34994a19b1e2a2dd9b9256c","observation_id":"c916829b-9808-4ebb-a0ce-b4bda5cf7a20","resolution":{"observed_at":"2026-08-07T12:50:40.138320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:56.588433Z","title":"R., Daulton, S., Letham, B., Wilson, A","venue":null,"work_id":"e7bacd82-cd76-4641-b9f4-4367f73815fd","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.241854Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:34dc951c4516c0b77baf18b81243c6b60876ef49aa6909f12a2b13518f2ed4cc","observation_id":"661e7698-f079-457d-91a0-dcbd759a411c","resolution":{"observed_at":"2026-08-07T12:50:56.750917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:56.286366Z","title":"Preference-based online learning with dueling bandits: A survey","venue":null,"work_id":"580201fe-f87d-4f38-ad8f-616374aa73ad","year":2021},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.361927Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:3896634d820d83d51ba6a48f85a71bffc5081c2f733d45dee289b88632234010","observation_id":"3c8de591-d8e2-458b-9040-58d0cb36bd85","resolution":{"observed_at":"2026-08-07T12:50:56.449269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:56.107674Z","title":"Stochastic contextual dueling bandits under linear stochastic transitivity models","venue":null,"work_id":"bf5b119e-50ab-4365-aef5-4ce557882dcc","year":2022},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.442785Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:681b70b3436b4bb10d3e4ac9a36bb7c851649db9952fbf9ad9227d995190391c","observation_id":"3b08b2bb-24a7-42e8-af6a-df979b24cc66","resolution":{"observed_at":"2026-08-07T12:50:56.187735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:55.869376Z","title":"Mat \\'e rn gaussian processes on riemannian manifolds","venue":null,"work_id":"1fad2ea8-a426-4204-bf30-2d3508d348ed","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.521123Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:3d35b44331a03bf2a52f013a75498cf7d9d9507a1607a6b32df64588197871e6","observation_id":"c5f9d829-ad58-45fd-b147-a251fe5e750a","resolution":{"observed_at":"2026-08-07T12:50:55.922717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:40.628781Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.628781Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:68570988f1fc2c61399f994ade7bdba04c47e59905205e07828bf3a8d586745d","observation_id":"1cbd7aa1-5dfe-4a1d-9f66-859d3c207769","resolution":{"observed_at":"2026-08-07T12:50:40.628781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1012.2599","last_updated":"2010-12-12T22:53:04Z","snapshot_observed_at":"2026-07-06T02:20:34.514024Z","submitted_at":"2010-12-12T22:53:04Z","title":"A Tutorial on Bayesian Optimization of Expensive Cost Functions, with Application to Active User Modeling and Hierarchical Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1012.2599","snapshot_observed_at":"2026-08-07T12:50:40.734979Z","title":"M., and De Freitas, N","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.734979Z"},"links":{"cited_paper":"/paper/1012.2599","citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:578ec8228f338584eee3e7e553b749b6775c7d9b1b3f1e58299a95c248ff3663","observation_id":"d1b04aac-25ff-468c-a4f1-279ce8a31e28","resolution":{"observed_at":"2026-08-07T12:50:40.734979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:55.555948Z","title":"Instructzero: Efficient instruction optimization for black-box large language models","venue":null,"work_id":"2260f282-0535-4a37-a29c-f6d297954680","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.835746Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:3a1cba88c5b9bebe16484143aa4ada74d36650664634cea893f54aa395361f79","observation_id":"eb9496c5-f672-4075-a016-e37658ba9289","resolution":{"observed_at":"2026-08-07T12:50:55.729489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:40.901099Z","title":"Human-in-the-loop: Provably efficient preference-based reinforcement learning with general function approximation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.901099Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:be0227e60ac282e40937c5dcf7181d5871de551e1412298e6aad09beedb93142","observation_id":"72f068b0-e951-4dec-aabc-ef40b7e314d5","resolution":{"observed_at":"2026-08-07T12:50:40.901099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:55.181231Z","title":null,"venue":null,"work_id":"6fed1a5e-1628-4c75-aed8-9310fcd1c5b9","year":2017},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.994901Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:8c9c19603339d70708dd5c569e85cf3120fc3bba6f104f14271e18f7cbc95f47","observation_id":"cd4f5627-73e6-42a9-9a40-4be5c0d094e4","resolution":{"observed_at":"2026-08-07T12:50:55.354090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:54.902670Z","title":"and Steinwart, I","venue":null,"work_id":"906fd6c8-5add-4685-a6e1-753040bd302e","year":2008},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.069695Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:57ee40ee5d143fecd335a2bd796fae6947fd54735e23a240e9913d0f2a4acb69","observation_id":"3a2067e6-4446-4226-8812-ca1d198dd0cc","resolution":{"observed_at":"2026-08-07T12:50:55.009181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:54.626290Z","title":null,"venue":null,"work_id":"9ffcabf7-22ab-48bc-9e71-893c891c7862","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.168084Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:0cb578388f26db0de187f4a003189b762bc54e0ffd54cf5bcdc0f84ceb5ed947","observation_id":"bf1ae0a8-8f2e-4f09-9963-fb340e6a3851","resolution":{"observed_at":"2026-08-07T12:50:54.743049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:54.264489Z","title":"E., Slivkins, A., and Zoghi, M","venue":null,"work_id":"76cc78fa-ff8b-437d-ae55-7ed7f6da1d89","year":2015},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.269844Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:f89b0fa92e4706276dfee0e3df9aa799e79c201b4f58621d198b560292016340","observation_id":"6dd47c75-eda3-44a6-93c1-9020fbd86d56","resolution":{"observed_at":"2026-08-07T12:50:54.433457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:53.905230Z","title":null,"venue":null,"work_id":"a8c90170-c7c6-488d-b1fe-f69cc059fff4","year":2017},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.351047Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:91f53149fb7a402e4a79581cd0c8810d58637e9e2df52a161280346277c23162","observation_id":"279f94d4-b194-4864-b290-d74173a76ca7","resolution":{"observed_at":"2026-08-07T12:50:54.070394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:53.626725Z","title":"Improved optimistic algorithms for logistic bandits","venue":null,"work_id":"98b041c2-6b6b-4ec7-8b3e-02147ac093c6","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.453532Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:b481bb8793de0072a6a7152796710f370edfaa17463f38ab5ef8aa0c25dc2ede","observation_id":"90cc3a77-2405-4f42-bf4c-0d4f49d85df7","resolution":{"observed_at":"2026-08-07T12:50:53.772960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.02811","last_updated":"2018-07-08T13:06:26Z","snapshot_observed_at":"2026-08-07T12:49:05.688504Z","submitted_at":"2018-07-08T13:06:26Z","title":"A Tutorial on Bayesian Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.02811","snapshot_observed_at":"2026-08-07T12:50:41.544682Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.544682Z"},"links":{"cited_paper":"/paper/1807.02811","citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:9adfdefaaece83817967f6b2fdfcd58b8416ea5ac1e1f937ca83de88f2338229","observation_id":"3fd1dca9-b811-4db7-8ba6-edaa73054cf9","resolution":{"observed_at":"2026-08-07T12:50:41.544682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:53.362846Z","title":"R., Pleiss, G., Bindel, D., Weinberger, K","venue":null,"work_id":"142cbbd8-5736-4ce3-9122-20ee339f18e8","year":2018},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.638418Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:b8737419461cb9879c6dbe2a0892a11263ea2b840476f5a10cc0339b95b7fd85","observation_id":"18fce1e8-13d2-40ae-9586-1d9ec0b24e46","resolution":{"observed_at":"2026-08-07T12:50:53.480243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:53.061553Z","title":null,"venue":null,"work_id":"f800bd32-9c4b-46cb-b198-0d818a5ae1af","year":2017},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.704728Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:a94320e79f52106b320681a1be86e9360eefcad3c13de19cf6c1cb53e14c03ae","observation_id":"b5164a3c-46a1-4518-9082-846da787c71c","resolution":{"observed_at":"2026-08-07T12:50:53.193134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:52.734546Z","title":"L., and Thomaz, A","venue":null,"work_id":"706e7fc8-267b-4a6e-824f-ca1b59ba4c71","year":2013},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.773886Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:38a2249c45c301c079f08d8a03902b5089570e8ff59c98e64418e2786aa9dd66","observation_id":"1cc4fddb-d77a-422f-bbb7-62bba9674992","resolution":{"observed_at":"2026-08-07T12:50:52.899224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:52.493125Z","title":"and Yang, X.-S","venue":null,"work_id":"6039a26e-391b-4ae4-ad7d-a867b5f73bac","year":2013},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.930302Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:1a08724357921f692f01282f39d82f43bc17239bd51b3912de6c91ecb06ad23a","observation_id":"f82de9f4-ae72-47bb-a88c-9b04475e04bf","resolution":{"observed_at":"2026-08-07T12:50:52.600042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:42.054479Z","title":"R., Schonlau, M., and Welch, W","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.054479Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:03f45b7e245dac12df289ad43bcf7f658dab2d7cf118c0e0914dce45ccf4f595","observation_id":"dad41594-2365-4926-9a1e-5a488c4bb929","resolution":{"observed_at":"2026-08-07T12:50:42.054479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:52.230911Z","title":"Feel-good thompson sampling for contextual dueling bandits","venue":null,"work_id":"e8e7f56d-0cfb-461a-92aa-925b4f96fede","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.145030Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:552c7bfee0cc257b61d4a19068a6e9ca77210bec4a1c6c364091eff5e1b6154f","observation_id":"807202dd-e4de-4525-b1ca-f3f9eeb24320","resolution":{"observed_at":"2026-08-07T12:50:52.335804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:51.976296Z","title":"and Scarlett, J","venue":null,"work_id":"13146126-4850-418d-bd92-f49988189201","year":2022},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.274206Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:f0c9011de94be7d9f6828e7f2fd32d32fee3f196fa1bbe2df573593fd198cd3e","observation_id":"70eed8b9-bb8e-4b6d-b810-cfc21206ee71","resolution":{"observed_at":"2026-08-07T12:50:52.109171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:51.757814Z","title":null,"venue":null,"work_id":"3d404248-6728-4636-a3d7-88e1f781ff1e","year":2023},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.368045Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:821b44c6c5dc570d6f7b5aeddf386c2734d0b2c2f002e06f94e50550d3f07beb","observation_id":"6fa7c559-fe37-473b-916b-3147b64858b7","resolution":{"observed_at":"2026-08-07T12:50:51.870471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:51.475990Z","title":null,"venue":null,"work_id":"68cebd78-a800-455d-b9de-d6f37e458b69","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.497274Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:dead3c32ad41f9d3e38e193c8ce6d162179f82ba54e6e5fdd593c4cd70103271","observation_id":"c52c829c-9edc-4326-9bd9-17ec706ccd74","resolution":{"observed_at":"2026-08-07T12:50:51.603727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00267","last_updated":"2025-03-20T14:23:17Z","snapshot_observed_at":"2026-07-06T16:55:25.413169Z","submitted_at":"2023-12-01T00:54:02Z","title":"Sample Efficient Preference Alignment in LLMs via Active Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00267","snapshot_observed_at":"2026-08-07T12:50:42.595875Z","title":"Sample efficient reinforcement learning from human feedback via active exploration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.595875Z"},"links":{"cited_paper":"/paper/2312.00267","citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:44245a61641f63456f7f4ed2a6982d751423f6d409e4cb98d02d8053f53fa1e6","observation_id":"3e05f0f4-440a-4c96-815a-b223275df31c","resolution":{"observed_at":"2026-08-07T12:50:42.595875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:51.176200Z","title":"Kernelized offline contextual dueling bandits","venue":null,"work_id":"d907dbce-0b2f-47b5-b68b-1476de9ac7a5","year":2023},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.722443Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:0960ef0b92d60e55e6ed2675bbbc4b9f568c3101a8a48efaab743f38dcf8cf13","observation_id":"05359119-0546-450b-85ca-779f84c2d013","resolution":{"observed_at":"2026-08-07T12:50:51.302536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.980394Z","title":"Functions of positive and negative type, and their connection with the theory of integral equations","venue":null,"work_id":"9cfd0ae4-de8d-44ab-92ae-e5d33b0cc20e","year":1909},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.844443Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:ad32053d8545a36446039ffb3cfec72ec23bda18e255ed29ab128bd031eee0d3","observation_id":"5a862fc4-f9e7-4c39-a3ff-b6c87c6ebf2d","resolution":{"observed_at":"2026-08-07T12:50:51.069454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.781160Z","title":"Projective preferential bayesian optimization","venue":null,"work_id":"8db2777f-09a1-4e37-a5f3-6868ec3ee809","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.936733Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:5de12908f63749bba624d0d88301c99870b3db5a0774701040e99c24a9a4f5fa","observation_id":"1ce9876e-4bd5-4bb8-86be-301ac54aa385","resolution":{"observed_at":"2026-08-07T12:50:50.884143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:43.040733Z","title":"Dueling posterior sampling for preference-based reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.040733Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:af6caa9ddf7a22ddd13d4facc2e2bab5ad33c065d38c6a49f65e509f6c660737","observation_id":"849b6473-3f9d-4ee8-883c-119846cf8701","resolution":{"observed_at":"2026-08-07T12:50:43.040733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:43.162585Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.162585Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:4e57054d2b8889763b07b5d37657b4e1de9afb8b12c578632e910853cc28cc21","observation_id":"8646b46f-3fbe-4102-89a5-ea926abb3064","resolution":{"observed_at":"2026-08-07T12:50:43.162585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.621243Z","title":"Bandits with preference feedback: A stackelberg game perspective","venue":null,"work_id":"8cb2dc32-3fc5-4dee-b588-41300b583ff1","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.268258Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:3b8add7b18be035dcdf4d23c6956dea394d9c119ad731270ae9ee642c7f71233","observation_id":"4f7d64a3-69ac-49b3-a6b5-ab2d59de08c1","resolution":{"observed_at":"2026-08-07T12:50:50.681901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:43.415191Z","title":"Scikit-learn: Machine learning in P ython","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.415191Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:f4568ea770af02e0d2e97b9bddb90bf09d04501a677f1fca0e1dc9bef7da5055","observation_id":"caa9fe46-d605-42c5-bc2a-bcebf3c6eac5","resolution":{"observed_at":"2026-08-07T12:50:43.415191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.432786Z","title":"Optimal algorithms for stochastic contextual preference bandits","venue":null,"work_id":"a163cc17-85ea-4b30-8036-197b5743c83b","year":2021},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.528257Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:98193a073dddd8129291582d68669bf8356c05ea3ffb13bb6e94b65add3b67e1","observation_id":"166d52dd-32ae-4492-b81d-5df8ea1d1138","resolution":{"observed_at":"2026-08-07T12:50:50.504449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.300897Z","title":"and Krishnamurthy, A","venue":null,"work_id":"1de89bb2-19bb-483c-9e0b-6cca87f6fd46","year":2022},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.638184Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:72eb9546e560e0698985ad0f5107a4434af9faceb1b0e1ca54b64e587c09161e","observation_id":"7d52213e-1a68-489b-9e55-ee72fe4bb353","resolution":{"observed_at":"2026-08-07T12:50:50.376160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.147441Z","title":"Dueling rl: Reinforcement learning with trajectory preferences","venue":null,"work_id":"1377c9c0-e822-4160-a788-0dee30720d9a","year":2023},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.712472Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:785bd9efed1ab325e3b46437baabbf981625405d17772b79e34aa17e8d1d8fdd","observation_id":"889bb251-af6e-403a-9647-950bd1ee4e92","resolution":{"observed_at":"2026-08-07T12:50:50.226512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.988179Z","title":"A domain-shrinking based bayesian optimization algorithm with order-optimal regret performance","venue":null,"work_id":"ab90587d-4e99-4db7-95cf-578d56899bc0","year":2021},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.782700Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:adea6238545715a79e46172de0d9bc597ebf3205ab069b3a5ff13b60c54e1318","observation_id":"1c144d77-19f3-46d8-b247-76c1035bb965","resolution":{"observed_at":"2026-08-07T12:50:50.071549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.811131Z","title":"Lower bounds on regret for noisy gaussian process bandit optimization","venue":null,"work_id":"4479792a-3709-4115-8cdc-eff2491adb64","year":2017},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.853547Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:f1abf20e30c32e924b3a31cb62a4762cc85f78d7dbcca94a50339b7ac1cf6953","observation_id":"c2c9467f-1cca-4af2-bb75-07d3faab1062","resolution":{"observed_at":"2026-08-07T12:50:49.875455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.610659Z","title":null,"venue":null,"work_id":"e8d5cff6-2f57-406b-a128-6feb5f5c9b03","year":2001},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.935161Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:1c56124168437663ab1393e603f0e3791d4eaabd24752ffebcd787bb7a1fbdd7","observation_id":"b123e8fe-ebfc-4bcf-940c-41a2afa6489c","resolution":{"observed_at":"2026-08-07T12:50:49.701942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:44.036902Z","title":"P., and De Freitas, N","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.036902Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:5a7ba6e930084b757fb3c9c00735c20228e87fbd0d876b8eb4960c9f92445e1c","observation_id":"3758a7e0-2e92-465b-bbf7-cdeb81572b1c","resolution":{"observed_at":"2026-08-07T12:50:44.036902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.415754Z","title":"M., and Seeger, M","venue":null,"work_id":"3de27fbc-7ff1-427c-a1ab-93e56d8486c4","year":2010},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.117889Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:bbccf2e06be1470537948bb1cd6be5bcfafcc46af89305302c5f823b31e25f9b","observation_id":"23b44e2a-b881-4f5f-981d-8fbcc8ea02c5","resolution":{"observed_at":"2026-08-07T12:50:49.499940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.248796Z","title":"Towards practical preferential bayesian optimization with skew gaussian processes","venue":null,"work_id":"da998bf3-1905-48ea-a1eb-8bae783f9fb0","year":2023},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.202090Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:46d39ffe58fc3176f2d0b01e42d91509009fb8aa6ea200be0bafee513e6e8c55","observation_id":"e8d65b47-20a1-4c62-9db7-57bebf343634","resolution":{"observed_at":"2026-08-07T12:50:49.311254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.068183Z","title":null,"venue":null,"work_id":"69fe6047-d993-4e7e-8f9f-644a83e9311e","year":1933},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.270455Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:ae2276573f465c8a6c616591b92364bb171f8633e7290946a2758f3e3535b3b0","observation_id":"a985fd11-9b1a-4b58-a2eb-372ec3ca4b69","resolution":{"observed_at":"2026-08-07T12:50:49.159137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:48.924088Z","title":"Optimal order simple regret for gaussian process bandits","venue":null,"work_id":"be02596c-cc81-4758-875a-f369a03d7407","year":2021},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.350553Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:f1b8c06697f76a95e7ccafdd51383e6923a18d035978ebe3a172794b67f5c4a0","observation_id":"08434648-ed7d-40f3-bf5d-6b6810b15521","resolution":{"observed_at":"2026-08-07T12:50:48.991095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:48.797137Z","title":"On information gain and regret bounds in gaussian process bandits","venue":null,"work_id":"e8299b57-d76b-48fb-9d29-b8c96b848fde","year":2021},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.435530Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:03d6579305962e2834d2c0465ce77a78955b5648e6418336aade4f223aaafc7e","observation_id":"b9381b72-7c92-4d46-9a8c-8c9188bc71d4","resolution":{"observed_at":"2026-08-07T12:50:48.847219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:48.605542Z","title":"Finite-time analysis of kernelised contextual bandits","venue":null,"work_id":"ed78e73e-42ed-4c6e-97f6-406cc39fa36f","year":2013},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.531719Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:398ce24215badafb41f749a14f20fd1b57ddcd9de00dea31a3d34c6202c559f7","observation_id":"4d154dbc-42cf-4bea-8214-ebb4695eacbe","resolution":{"observed_at":"2026-08-07T12:50:48.739454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:48.395164Z","title":null,"venue":null,"work_id":"c79f1586-9d47-4018-8417-c40b8756431a","year":2025},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.601543Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:dce490b3adcd298acbcb0acef9ce4fa2b7708ecf7088708346855e4e0c55285e","observation_id":"b91b39b6-17ce-4ffc-a485-0509836099e9","resolution":{"observed_at":"2026-08-07T12:50:48.477948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:44.680747Z","title":"High-dimensional probability: An introduction with applications in data science, volume 47","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.680747Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:c3668f0f358bde49d3910ae936863c61e1df3bd123b2794c5fd5398a11c00dfc","observation_id":"4fd5c7cf-d33e-4877-9957-135aea590e2a","resolution":{"observed_at":"2026-08-07T12:50:44.680747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:48.091759Z","title":null,"venue":null,"work_id":"17cc62b3-f975-4982-939b-f51e12dcb135","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.789087Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:89af6eac7b18da8e493df0f29d30662a181e1d7cd633993fb47d37a9a610241b","observation_id":"25dd1c45-fc65-4544-b0e1-c48f8c1ee64d","resolution":{"observed_at":"2026-08-07T12:50:48.210392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:47.848091Z","title":"and Sun, W","venue":null,"work_id":"bf1da5bf-c90d-455e-aaef-a68fb73e8d6d","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.884469Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:aa229073b7fa27933cff80f6c8f1ebf9a42b80d43a2d29db2ea6a2c5e22d4714","observation_id":"6e71dfec-1ae2-40e0-934d-9d0c8eee30b4","resolution":{"observed_at":"2026-08-07T12:50:47.955298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:47.568278Z","title":"Principled preferential bayesian optimization","venue":null,"work_id":"67617f50-6d7f-4544-b1ac-540588a688e4","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.981051Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:71bf0edb2674fe79a6fac55e4d1cbc62288ad0bc81efc3d28956c188c0912473","observation_id":"92e305af-7512-4a3b-85d2-659758cb44ae","resolution":{"observed_at":"2026-08-07T12:50:47.700299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:47.336627Z","title":"Zeroth order non-convex optimization with dueling-choice bandits","venue":null,"work_id":"6cafb28a-3721-4ee6-9251-cdf8908205c2","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.103390Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:6d01ec4f9a77582d463bf0e624d87d9d9bda2632530e0ab544e3dca4e451e737","observation_id":"bb3d5c7e-ab48-4452-b719-d08bd5b063cb","resolution":{"observed_at":"2026-08-07T12:50:47.449181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:47.084273Z","title":"Preference-based reinforcement learning with finite-time guarantees","venue":null,"work_id":"0482bce6-2fb2-4feb-8648-54ffae306039","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.192620Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:3c4ed45d68d5335e5af1962ecd9c3a9b2890af60ba2632d1742cb782c4298969","observation_id":"f840f36d-5b10-4be3-8f71-ee7fb1ae6126","resolution":{"observed_at":"2026-08-07T12:50:47.176236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:46.825292Z","title":"and Joachims, T","venue":null,"work_id":"998b39d0-574d-4423-aaa0-29841e9c0f42","year":2009},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.253187Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:867ffb72f113e0f2875e0c3b9973057739cdd9819f46212bcb100ae376d2acd2","observation_id":"9f09a41f-a9d6-47d5-91eb-6c09adb7e6d7","resolution":{"observed_at":"2026-08-07T12:50:46.923255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:46.556501Z","title":"The k-armed dueling bandits problem","venue":null,"work_id":"5576a44a-cc61-4fb5-b5d0-90ee4d51ee14","year":2012},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.318578Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:06f6f15026a24be2ac78392df7ec7cd2f9062bf2a8777a4929209fc9b1f2b9ce","observation_id":"f90a452d-7f1b-4882-ade5-a0cca8fe9794","resolution":{"observed_at":"2026-08-07T12:50:46.669843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:46.282232Z","title":"D., and Sun, W","venue":null,"work_id":"e83a1915-43d3-4c6c-9d77-e31ad46c7cef","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.418047Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:e3300b45f4f330bbe44610a74293739f8ca78082cfbcb2e4ed8c30cf51b3101d","observation_id":"084eb858-f460-4be7-b7e6-405729726a10","resolution":{"observed_at":"2026-08-07T12:50:46.427524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:46.081066Z","title":"Relative upper confidence bound for the k-armed dueling bandit problem","venue":null,"work_id":"8217c219-9a00-4825-8916-07e2265411ca","year":2014},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.531566Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:7159a0df5f5e8fb5e96d9b1300a371c902ad97cde9aab6d5e61832123de1a6aa","observation_id":"9d3dc523-5eee-4577-b38a-cb2a093b2b88","resolution":{"observed_at":"2026-08-07T12:50:46.179608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:45.872482Z","title":"Mergerucb: A method for large-scale online ranker evaluation","venue":null,"work_id":"e4d5f432-89c8-4e60-bca3-2c9cdfd5c956","year":2015},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.634287Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:289e759b90dcdbefff8cb282b0a41552c1a6c67bc8ff78f9b2d95c46349dae06","observation_id":"243d5c50-0041-43b5-9901-9c4cb9c5cdb0","resolution":{"observed_at":"2026-08-07T12:50:45.950061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T15:59:10.795614Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.23673."}