{"as_of":"2026-08-17T16:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:870f1f4c3833fe2434ee6661261b6e660c1bf6a0fe8910974ab89da111abb7cc","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:41:31.060383Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T01:06:19.756032Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T01:10:51.536288Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"cited_work":{"arxiv_id":"2504.12016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12016","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Active human feedback collection via neural contextual dueling bandits","venue":null,"work_id":"2c505083-b635-46db-8916-85d85b489cfb","year":2025},"citing_paper":{"arxiv_id":"2505.19241","last_updated":"2026-05-14T18:01:35Z","snapshot_observed_at":"2026-08-12T14:46:49.151451Z","submitted_at":"2025-05-25T17:42:52Z","title":"ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T01:06:19.756032Z"},"links":{"cited_paper":"/paper/2504.12016","citing_paper":"/paper/2505.19241"},"observation_digest":"sha256:5aaf89efa47c0a1ee41fd8de510bbaf1957dbae8aa18d4ef9c4d3905579f7bc5","observation_id":"1c677bae-ddef-450e-865d-e26463d7a187","resolution":{"observed_at":"2026-05-22T01:10:51.539069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.12016/citation-record","integrity":"/paper/2504.12016/integrity","json":"/paper/2504.12016/citation-record.json","paper":"/paper/2504.12016"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.841943Z","title":"Improved algorithms for linear stochastic bandits","venue":null,"work_id":"180d21be-d887-4e2a-bfbc-7c399ce70b9e","year":2011},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.834866Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:0040496584eb25c98b853a78cb47c2c48e66a54b5b2fa05184ebf274c24bae69","observation_id":"4b92bfea-da5a-4e4e-b7b9-1be62bf2b948","resolution":{"observed_at":"2026-08-16T12:41:31.845727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.718321Z","title":"Thompson sampling for contextual bandits with linear payoffs","venue":null,"work_id":"81360bcb-b5fe-492c-90e7-baea5063f55c","year":2013},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.840112Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:9f209f5d389c62da165c2033fbac8e94390ac12fde20f6b1036d2cfec3179a86","observation_id":"a9645d9c-3a57-4d78-b9b1-9f28b3ac4a87","resolution":{"observed_at":"2026-08-16T12:41:31.835873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.708185Z","title":"Reducing dueling bandits to cardinal bandits","venue":null,"work_id":"97a6cf5a-81b9-4f26-a06e-20a1e56c8681","year":2014},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.844259Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:ec6a8812fba5b2e55bba3ff3558fde0d861d79acbd36e95458fd3a78163bf45f","observation_id":"adcd636b-0d17-4df8-9b4a-6de545114d1b","resolution":{"observed_at":"2026-08-16T12:41:31.711781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.697645Z","title":"Finite-time analysis of the multiarmed bandit problem","venue":null,"work_id":"bcf9bd47-664c-4cef-87ea-869595f2e8bf","year":2002},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.847884Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:e403e9e7ee2969931bacbc194d3ceb00fefb446e511dfba23d595b8ed26df68c","observation_id":"d78e08d1-a64f-4d41-b23a-ee344c6c0475","resolution":{"observed_at":"2026-08-16T12:41:31.701442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06516","last_updated":"2022-11-11T23:55:53Z","snapshot_observed_at":"2026-08-16T16:16:47.470117Z","submitted_at":"2022-11-11T23:55:53Z","title":"Bandits for Online Calibration: An Application to Content Moderation on Social Media Platforms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06516","snapshot_observed_at":"2026-08-16T12:41:30.852505Z","title":"Bandits for online calibration: An application to content moderation on social media platforms","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.852505Z"},"links":{"cited_paper":"/paper/2211.06516","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:b2ff6f7fcbab948f403428ce94127fe126465352ea162421e27eb43859f96e3e","observation_id":"7ec3452d-8f7c-472f-b818-d7c9dff37954","resolution":{"observed_at":"2026-08-16T12:41:30.852505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02069","last_updated":"2026-05-28T15:37:14Z","snapshot_observed_at":"2026-08-17T12:11:32.432498Z","submitted_at":"2025-05-04T11:23:16Z","title":"Neural Logistic Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02069","snapshot_observed_at":"2026-08-16T12:41:30.857457Z","title":"Neural logistic bandits","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.857457Z"},"links":{"cited_paper":"/paper/2505.02069","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:8fdea94defe5700bc13ca9afd851fe63ba2aca5712e904fc2934f3c6f5a3cffd","observation_id":"f96c0e42-fb07-4b39-93de-fadfb47162ba","resolution":{"observed_at":"2026-08-16T12:41:30.857457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T12:41:30.862004Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.862004Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:9b680d492bfb74c1f7fb7f15b523789cd2670febbd546dceb28f5383bdd5f9c2","observation_id":"52a4c249-e878-47d1-b9fc-f3addf71d6fa","resolution":{"observed_at":"2026-08-16T12:41:30.862004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.687706Z","title":"Ee-net: Exploitation-exploration neural networks in contextual bandits","venue":null,"work_id":"cc71653b-ca5b-4490-864f-72d63133f1d3","year":2022},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.865789Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:a83ca74d8cf2a48a2b6537567caa46e824ba0394edd33a663606b0ba92b76fcf","observation_id":"9a43def9-9f82-4667-8dc9-267e16499be9","resolution":{"observed_at":"2026-08-16T12:41:31.691294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.677265Z","title":"Preference-based online learning with dueling bandits: A survey","venue":null,"work_id":"abe23b64-50bb-432f-9722-bf36470d0e50","year":2021},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.869175Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:2238560e7de940b4078e600083d66064d85bc06f423030b5141e04ae169846f5","observation_id":"7312d001-512f-43a1-b496-71e90252b08a","resolution":{"observed_at":"2026-08-16T12:41:31.681049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.666065Z","title":"Stochastic contextual dueling bandits under linear stochastic transitivity models","venue":null,"work_id":"94a5a97c-0f96-41ff-987a-2a4d4aa7550f","year":2022},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.872735Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:29c643045bdec06d3f8ddae9de580f15517d632f63b8423d1795c689b4c374fe","observation_id":"8099a301-597b-4de6-8a3d-035f5a9d3650","resolution":{"observed_at":"2026-08-16T12:41:31.670033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.654332Z","title":"An empirical evaluation of thompson sampling","venue":null,"work_id":"1c1b2f7a-31e1-458b-a7d1-19558fb6f7e6","year":2011},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.877076Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:c5d9dacffe9c563407d52e9351a1f972f8f0fa21870ae64261bf85f111c90131","observation_id":"b56997e0-b72f-45c1-bac9-b95c7a9464d7","resolution":{"observed_at":"2026-08-16T12:41:31.658332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08555","last_updated":"2024-04-16T00:22:16Z","snapshot_observed_at":"2026-08-16T14:01:23.195945Z","submitted_at":"2024-04-12T15:54:15Z","title":"RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08555","snapshot_observed_at":"2026-08-16T12:41:30.880791Z","title":"Rlhf deciphered: A critical analysis of reinforcement learning from human feedback for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.880791Z"},"links":{"cited_paper":"/paper/2404.08555","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:68cf7bcf34d7be8528f405b12e8d89d12b90adbfde9271eaeaa587cf3031738f","observation_id":"20c5dc23-7042-44d5-a059-4f7f8189e590","resolution":{"observed_at":"2026-08-16T12:41:30.880791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.642854Z","title":"On kernelized multi-armed bandits","venue":null,"work_id":"60e7b29e-defb-44c6-b37d-5a661e955a6e","year":2017},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.884656Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:d7c23c994177032811d26618d679963c57231a83236cadb492f54543f535e27c","observation_id":"bdb3c793-696d-4793-ba92-dbda4c0d9766","resolution":{"observed_at":"2026-08-16T12:41:31.646769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.631849Z","title":"Federated neural bandits","venue":null,"work_id":"97de4c51-931f-4a45-8293-68af8b2df115","year":2023},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.888391Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:2f2ce55dd2831d1c3d2d329a09cc1a006db8908ee9bec2d728fb1b14f90c6f55","observation_id":"b320fcd6-968d-4a54-8844-aad54f200d00","resolution":{"observed_at":"2026-08-16T12:41:31.635328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-16T14:18:04.510866Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-08-16T12:41:30.891792Z","title":"Provably sample efficient rlhf via active preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.891792Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:e24ad21ce071b892b4644d7e887f481c93a230997768e9e1087f0196dc7ac4ce","observation_id":"8a06a7be-26ae-4b23-9a81-9672ddcaf82f","resolution":{"observed_at":"2026-08-16T12:41:30.891792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.621462Z","title":"Contextual bandits with online neural regression","venue":null,"work_id":"ddea61d7-c11b-4087-a77f-308219b658b1","year":2024},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.895545Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:beb39cddd68c4ef4170b28cfe36aab8351cff75ff69ef2c0f92a8e1195da6d19","observation_id":"38a00c37-13f7-452f-b3d5-8a2f868e4fdf","resolution":{"observed_at":"2026-08-16T12:41:31.625397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00968","last_updated":"2024-10-15T03:38:23Z","snapshot_observed_at":"2026-08-16T14:55:58.788684Z","submitted_at":"2023-10-02T08:15:52Z","title":"Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00968","snapshot_observed_at":"2026-08-16T12:41:30.899860Z","title":"Variance-aware regret bounds for stochastic contextual dueling bandits","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.899860Z"},"links":{"cited_paper":"/paper/2310.00968","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:4e7803c7c99a2018a7318759d548e33023f0ab1d1eaf305852179ac57c3717e2","observation_id":"29fb0a0f-9457-4bd4-9373-f539774e14a8","resolution":{"observed_at":"2026-08-16T12:41:30.899860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.611111Z","title":"A relative exponential weighing algorithm for adversarial utility-based dueling bandits","venue":null,"work_id":"39869a4c-1c97-4455-82c2-2c47d59b7a2d","year":2015},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.903866Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:48c41c66c25b786a20b2dbb3bf0117ffc2af21d3549b4b3b21f18c8e9748d43e","observation_id":"4b2709d2-84ff-4e9d-ac16-bd9157d54725","resolution":{"observed_at":"2026-08-16T12:41:31.615054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.599815Z","title":"Mm algorithms for generalized bradley-terry models","venue":null,"work_id":"d2075c92-6c5f-4e2a-8d13-f093641ca1c7","year":2004},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.907383Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:fee0d283605c8476b5b5a179346446079a13c4ab46d4f0df7c0aaf1d14e04bed","observation_id":"8d2ac834-21f7-442c-ab0c-881fd6e2513a","resolution":{"observed_at":"2026-08-16T12:41:31.603611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.587919Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":"56fb41ad-c432-4870-8b84-d27a5d5ff0ff","year":2018},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.911587Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:5551bdb5a402ae0e5e1abe41563a4f22881c1bd53ffcba0dbc2eacc02b11da74","observation_id":"1e3b336f-aaf8-4cef-906a-10f91b806d32","resolution":{"observed_at":"2026-08-16T12:41:31.591942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09401","last_updated":"2025-02-11T18:18:59Z","snapshot_observed_at":"2026-08-17T03:04:22.544692Z","submitted_at":"2024-02-14T18:58:40Z","title":"Reinforcement Learning from Human Feedback with Active Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09401","snapshot_observed_at":"2026-08-16T12:41:30.916115Z","title":"Reinforcement learning from human feedback with active queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.916115Z"},"links":{"cited_paper":"/paper/2402.09401","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:8af5abbf48ee773fd2a7b85403b4fc38e8f625e906ed7ee8ce0b4b758414a2b5","observation_id":"19c40104-86f5-48a9-a5f5-d6374f1e5341","resolution":{"observed_at":"2026-08-16T12:41:30.916115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.575755Z","title":"A fast bandit algorithm for recommendation to users with heterogenous tastes","venue":null,"work_id":"eb204337-7d97-4ca3-88c4-e617f6572ae9","year":2013},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.919857Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:937976f6cd1a6b8cc9640f672bcd4e718e9dc513997e39cad5a8e8446fe0d8ef","observation_id":"264f5d06-b2b0-4837-af01-5ff28cccc185","resolution":{"observed_at":"2026-08-16T12:41:31.579754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.564763Z","title":"Regret lower bound and optimal algorithm in dueling bandit problem","venue":null,"work_id":"1ff37689-401d-48b3-8312-8e0c16bfd0c5","year":2015},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.923325Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:1cf518fe33d245b0f6e8effbfd2fe309919d15d6ce3976506cc6f23b83a465e0","observation_id":"8fe26830-3893-4cc3-b7cf-ae0509a9532e","resolution":{"observed_at":"2026-08-16T12:41:31.568463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.552522Z","title":"Asymptotically efficient adaptive allocation rules","venue":null,"work_id":"8ae121ff-3892-43e7-88ab-c9757b3cd3b4","year":1985},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.927348Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:199f3f96f1546daa17f1004474babc7dfd177d801116dabd7df2b0333c73ba5e","observation_id":"d4c74a89-3c93-4501-8f4b-ea2dec209c7f","resolution":{"observed_at":"2026-08-16T12:41:31.556806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.541479Z","title":"Bandit Algorithms","venue":null,"work_id":"becb716d-e991-4d4e-b9c4-0e6d0d029932","year":2020},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.931922Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:7ba7c23cc8c1e57c5527ae93c232123f7166dc22cb92d75897b6659a7be7ee44","observation_id":"090329ac-a71a-4489-b86b-9507d7079227","resolution":{"observed_at":"2026-08-16T12:41:31.545036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.530595Z","title":"Provably optimal algorithms for generalized linear contextual bandits","venue":null,"work_id":"6cc0b169-f80c-4c27-9394-42cdf45c6aec","year":2017},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.935762Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:d9f8ab6e3c904d37c139e90a49d79dc133a2f3be6b7b9cd7b58f99d2e8125842","observation_id":"2140c30b-8451-4a54-a330-624278a32a88","resolution":{"observed_at":"2026-08-16T12:41:31.534440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06013","last_updated":"2024-04-09T04:45:18Z","snapshot_observed_at":"2026-08-16T14:02:31.873327Z","submitted_at":"2024-04-09T04:45:18Z","title":"Feel-Good Thompson Sampling for Contextual Dueling Bandits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06013","snapshot_observed_at":"2026-08-16T12:41:30.940328Z","title":"Feel-good thompson sampling for contextual dueling bandits","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.940328Z"},"links":{"cited_paper":"/paper/2404.06013","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:3953ee2348ebcad6c888d4c3d3584d8856b19e974096c02c29453fd89a917599","observation_id":"3c157c77-3234-4dfd-9690-f68fc4b83c0b","resolution":{"observed_at":"2026-08-16T12:41:30.940328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02905","last_updated":"2024-06-23T23:59:53Z","snapshot_observed_at":"2026-08-16T14:56:01.973568Z","submitted_at":"2023-10-02T02:01:16Z","title":"Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02905","snapshot_observed_at":"2026-08-16T12:41:30.943994Z","title":"Use your instinct: Instruction optimization using neural bandits coupled with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.943994Z"},"links":{"cited_paper":"/paper/2310.02905","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:41077a250731d7e38a49098e101e53479b952b26fffb86043812d044ea9ef55f","observation_id":"7bd464a2-91f2-436e-b4a0-a7980a855f51","resolution":{"observed_at":"2026-08-16T12:41:30.943994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17346","last_updated":"2024-05-27T16:49:29Z","snapshot_observed_at":"2026-08-16T13:48:57.968658Z","submitted_at":"2024-05-27T16:49:29Z","title":"Prompt Optimization with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17346","snapshot_observed_at":"2026-08-16T12:41:30.947907Z","title":"Prompt optimization with human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.947907Z"},"links":{"cited_paper":"/paper/2405.17346","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:909f3ba766c95da3428993345fcb5a6b57424f16ffcfc237f168e4e4f4fd57a4","observation_id":"8300f739-f34b-460a-9c24-a4023fa59254","resolution":{"observed_at":"2026-08-16T12:41:30.947907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:30.951747Z","title":"Individual choice behavior: A theoretical analysis","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.951747Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:00bf895a1d41c66b56d70ee94b6aa54ef8c8d2638fa2b1faef2482e0cacccd7a","observation_id":"278c2e85-d364-49a7-a783-e2fbfa2d9904","resolution":{"observed_at":"2026-08-16T12:41:30.951747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00267","last_updated":"2025-03-20T14:23:17Z","snapshot_observed_at":"2026-08-17T07:14:09.030620Z","submitted_at":"2023-12-01T00:54:02Z","title":"Sample Efficient Preference Alignment in LLMs via Active Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00267","snapshot_observed_at":"2026-08-16T12:41:30.955696Z","title":"Sample efficient reinforcement learning from human feedback via active exploration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.955696Z"},"links":{"cited_paper":"/paper/2312.00267","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:4cf39aa737b1883b3e84de90f148d03820aa598be11ced8c613d84d9be773d07","observation_id":"0ebf2c5f-4315-4abd-bcad-adf4dd5319ea","resolution":{"observed_at":"2026-08-16T12:41:30.955696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11147","last_updated":"2022-03-21T17:26:29Z","snapshot_observed_at":"2026-08-01T19:23:25.711617Z","submitted_at":"2022-03-21T17:26:29Z","title":"Teaching language models to support answers with verified quotes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11147","snapshot_observed_at":"2026-08-16T12:41:30.959827Z","title":"Teaching language models to support answers with verified quotes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.959827Z"},"links":{"cited_paper":"/paper/2203.11147","citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:97471311ea393517d6200c6a3a12061cf503f3ff5003246951e695c7af4a3d9f","observation_id":"2069cad4-d689-406c-afde-9eb895806c61","resolution":{"observed_at":"2026-08-16T12:41:30.959827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.513602Z","title":"Deep bayesian bandits showdown: An empirical comparison of bayesian deep networks for thompson sampling","venue":null,"work_id":"9cf27dad-fccf-4f46-a780-58099676271c","year":2018},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.964513Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:fec359ac97ab19640d8b3bbf33de897fa52d6f585ca9d6dc7737a65f4fe69e84","observation_id":"82d87dc1-be05-49ef-8102-dff7346f7045","resolution":{"observed_at":"2026-08-16T12:41:31.517327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.502918Z","title":"Optimal algorithms for stochastic contextual preference bandits","venue":null,"work_id":"dacc00da-ffbe-4ccb-a7d3-79c67141afa4","year":2021},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.968362Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:cd7bbbdf9fc1066278e1730c7665f90662e359c142ca316ba07c3e7f038ce752","observation_id":"9c5d88ae-ffac-4c96-9f95-a37c03de196d","resolution":{"observed_at":"2026-08-16T12:41:31.506725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.492535Z","title":"Battle of bandits","venue":null,"work_id":"f6239ba1-ad34-4964-9a63-a2c14b4ab39f","year":2018},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.971875Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:7ad47d7467cd9c14d8636ef300557adbaab994e2872bb3ac72012b609059ba2c","observation_id":"93427b48-f9a3-4c15-8013-0f3eeca7e165","resolution":{"observed_at":"2026-08-16T12:41:31.496166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.481871Z","title":"Active ranking with subset-wise preferences","venue":null,"work_id":"97b6883a-5870-46c7-bc38-0969d2ee69e7","year":2019},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.975493Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:93e58df51029c18a893577acecd2e5e82b1905982ab2d7c4e7e7a39c6992bcb4","observation_id":"39c6f195-ae93-4208-8fe3-5b4fe1c3c5e3","resolution":{"observed_at":"2026-08-16T12:41:31.485691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.471196Z","title":"Pac battling bandits in the plackett-luce model","venue":null,"work_id":"1373d776-6c74-4727-8e39-36c0d1227cba","year":2019},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.978837Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:4f06df55f88fa78f0992cebd8abcc9058099c562ea2de7ff7ec8509a0dc512c4","observation_id":"98d39aea-4964-4a15-bf8d-606e9f43d0f1","resolution":{"observed_at":"2026-08-16T12:41:31.474812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.460715Z","title":"Efficient and optimal algorithms for contextual dueling bandits under realizability","venue":null,"work_id":"aa2fd4b1-3986-4f17-8639-5566106213f9","year":2022},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.982868Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:63bb7d13bf36bb3d5ea4aebbe60c2d9b66579010bae808d3717258b7631210ca","observation_id":"9d5c356e-0aaa-44ce-a094-46d3311f01fe","resolution":{"observed_at":"2026-08-16T12:41:31.464377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.450218Z","title":"Computing parametric ranking models via rank-breaking","venue":null,"work_id":"c58dc87d-2761-48cb-9203-26d6d2c1f3f2","year":2014},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.986131Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:405f2495eb9c35f8aede387adf9ffff36b7172fd6856458225967f47baad1af9","observation_id":"eb47f4f3-89ee-4281-8013-9840548d9a26","resolution":{"observed_at":"2026-08-16T12:41:31.453961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.436978Z","title":"Gaussian process optimization in the bandit setting: No regret and experimental design","venue":null,"work_id":"d4e7ec4e-b3ad-421b-9008-a88c436449b2","year":2010},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.989299Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:a04d4de737c70f51d9d9344b18cd83e764038b444d12b0114757c9d9deaca0f5","observation_id":"664ec347-ec3f-4de6-b9fe-ea9d55c6f0a8","resolution":{"observed_at":"2026-08-16T12:41:31.442321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.424608Z","title":"On the likelihood that one unknown probability exceeds another in view of the evidence of two samples","venue":null,"work_id":"99224272-edbb-4d7b-825c-32f6eaf44d78","year":1933},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.993481Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:e1cc878c7367fe8bd2bb8d2d6edd393831112ef6b4bbf6a01ec2cfb1c435f7a3","observation_id":"ee242278-69c0-46d2-8d3f-851be3763a74","resolution":{"observed_at":"2026-08-16T12:41:31.429551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.412889Z","title":"User-friendly tail bounds for sums of random matrices","venue":null,"work_id":"5b9896ab-62ce-4064-8ad4-353925a342fb","year":2012},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:30.998088Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:95c1f24b0b786cfa08c8d05871988d001cf4ca9a98312313bc589a3dcc752cec","observation_id":"e94b8650-1298-4d6a-8a04-65ae2a7c7244","resolution":{"observed_at":"2026-08-16T12:41:31.417330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.401484Z","title":"Online algorithm for unsupervised sensor selection","venue":null,"work_id":"7249ae5e-1578-4beb-b963-37242434892f","year":2019},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.001315Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:b2f7814da8268e9e46a9d41e37c1873d27d57587866f026c78c4815a334df789","observation_id":"8e9f64dc-d676-456e-a592-dd5078da59d3","resolution":{"observed_at":"2026-08-16T12:41:31.405276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.391172Z","title":"Thompson sampling for unsupervised sequential selection","venue":null,"work_id":"5ddd8aaa-42aa-4003-8264-c41a41951c7f","year":2020},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.004742Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:6d8319f800459ab28f3e99fc5cf177856a217fef212099c66baf986617af8d37","observation_id":"5ce20994-2cb4-4923-b847-97ed38d9bd5f","resolution":{"observed_at":"2026-08-16T12:41:31.394635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.379178Z","title":"Online algorithm for unsupervised sequential selection with contextual information","venue":null,"work_id":"a8b15cb1-82ba-4f39-9ff2-38b3e775e759","year":2020},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.007879Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:230557dff01f18722ce3d49398b577b04e53f7704da29a3c273e6723345f0d4d","observation_id":"79504d2e-c551-41c1-b322-9d305db06b91","resolution":{"observed_at":"2026-08-16T12:41:31.383866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.011444Z","title":"Neural dueling bandits: Preference-based optimization with human feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.011444Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:5a34105f956f98341180def37d426326e8110f9f757f19dcd32d87f5ccc40b8c","observation_id":"4f28bc8c-24cc-47ec-92fa-aa8d5637d839","resolution":{"observed_at":"2026-08-16T12:41:31.011444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.361789Z","title":"Gaussian Processes for Machine Learning","venue":null,"work_id":"e423befd-981f-4fcd-a98d-6b2c1ab31413","year":2006},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.015178Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:045f83a7f3b7cfda24a423a0edb4d1f2193adfb7e420e275f108d2c84039d157","observation_id":"6e706e87-c5bf-43ac-8bcb-806d9ee62a2a","resolution":{"observed_at":"2026-08-16T12:41:31.365507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.351287Z","title":"Personalized news recommendation: Methods and challenges","venue":null,"work_id":"5758f616-a1f5-41af-9ad1-6341cf5ab65c","year":2023},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.018904Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:eb2b8acd89777b4f79c4c81bceed8a2b0fa039c1773135bda60af0cc211bdd4a","observation_id":"d4304843-3dec-4557-b4c3-5e41b9f2fbb2","resolution":{"observed_at":"2026-08-16T12:41:31.355016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.340437Z","title":"Neural contextual bandits with deep representation and shallow exploration","venue":null,"work_id":"b1c21257-b01b-424a-8921-a37b5140867e","year":2022},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.022322Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:249e65c8e78cc65b9215d8717e431f6b340c447bd161492e1766c33077e42e28","observation_id":"d5ee8ddd-2d55-423e-9b24-8198a054966f","resolution":{"observed_at":"2026-08-16T12:41:31.344204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.328668Z","title":"Conversational dueling bandits in generalized linear models","venue":null,"work_id":"0624d88f-95df-4fdd-ac40-b0bd42cab8b3","year":2024},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.026274Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:fb2d602b8e604848b2351e76235ad61218c67b5f0a18713ce20e826502a57f40","observation_id":"b8dc5c22-932e-4233-8114-eb2ba34e2e71","resolution":{"observed_at":"2026-08-16T12:41:31.332415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.315204Z","title":"Interactively optimizing information retrieval systems as a dueling bandits problem","venue":null,"work_id":"b237f8f7-0b75-4671-b140-e4b713f5ae45","year":2009},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.029949Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:ce7ffd1ff5aa051f35cf1bfddb3d8db5ac78f499171ea04974d0d8085db7b717","observation_id":"3983f234-323c-40a4-a63d-42b824989da0","resolution":{"observed_at":"2026-08-16T12:41:31.319415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.303318Z","title":"Beat the mean bandit","venue":null,"work_id":"61aac6b2-7422-4b8e-91aa-0e97a15c56fc","year":2011},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.033340Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:29a97b7f9d6e4866fb3a83aa195c932be11257410d415c4c4d62bdbd9a6336aa","observation_id":"2b0c2085-7d11-4cb6-9588-487fbbe90474","resolution":{"observed_at":"2026-08-16T12:41:31.307710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.290636Z","title":"The k-armed dueling bandits problem","venue":null,"work_id":"f23c122f-ce94-4317-bba2-7c31ef6c8fac","year":2012},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.037869Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:a230035ed1d85143afe919ce1c83c74ed3afe95cfe3f548563ba9ee51c9940ef","observation_id":"211bb2f3-2520-4da6-927e-ed0338cea2c0","resolution":{"observed_at":"2026-08-16T12:41:31.294853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.279150Z","title":"Neural Thompson sampling","venue":null,"work_id":"199f47cf-ec05-404a-97d4-70c715274e23","year":2021},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.041757Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:528b522ba1fc36f72766f77e035aa00aa227a7eca674cb8b06c83e85944c02db","observation_id":"74ecfffa-3239-48b9-b6e9-e4fae2f6a09f","resolution":{"observed_at":"2026-08-16T12:41:31.282920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.267579Z","title":"Prompt learning for news recommendation","venue":null,"work_id":"3fea65d8-2887-4c2d-9f59-44744d08f557","year":2023},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.045186Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:eab0754a8d8ff271579a6301e0c726d0b73e29112ac17b787b9471fc089f78de","observation_id":"2e9a3248-f4e1-45de-aabe-3b9ab50b412c","resolution":{"observed_at":"2026-08-16T12:41:31.271839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.256766Z","title":"Neural contextual bandits with UCB -based exploration","venue":null,"work_id":"fea0cebf-0479-4323-8af2-da1a94a48c4a","year":2020},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.049962Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:79a81dfb131a3f974ee76bf0102fd143661d0037f0fabfdc87dd3500ad4ac5f1","observation_id":"0390bddf-6d4e-4f22-b23f-ea587fc15d69","resolution":{"observed_at":"2026-08-16T12:41:31.260521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.245768Z","title":"Principled reinforcement learning with human feedback from pairwise or k-wise comparisons","venue":null,"work_id":"f04a5953-1843-4b15-9578-b78ed496357e","year":2023},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.053242Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:45061bf039310106a786751ad2796f2b3df71ac3eb47785512ab59036ab46f39","observation_id":"81938446-e3cc-4408-988e-65d45bf51ea6","resolution":{"observed_at":"2026-08-16T12:41:31.249600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.233110Z","title":"Relative upper confidence bound for the k-armed dueling bandit problem","venue":null,"work_id":"a614457c-2886-424e-aa16-d94cf75bf930","year":2014},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.056756Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:569a66c283953db63dd25ee2882ce491252c1fa17255100abe881fd72e20a73f","observation_id":"56ec91cb-4348-4cc5-ad2f-539cd85d4c6c","resolution":{"observed_at":"2026-08-16T12:41:31.237658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:41:31.218420Z","title":"Relative confidence sampling for efficient on-line ranker evaluation","venue":null,"work_id":"b2ef98c1-81fd-4061-b424-087ce34c5910","year":2014},"citing_paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T12:41:31.060383Z"},"links":{"citing_paper":"/paper/2504.12016"},"observation_digest":"sha256:770a7c1bb6d8c7ff80247bbe83dde279e76a06d513d7100c281319c256646af9","observation_id":"28b099bf-4a80-4cf7-a92f-413e2588e34f","resolution":{"observed_at":"2026-08-16T12:41:31.224928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12016","last_updated":"2025-07-16T20:57:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T12:12:14.813184Z","submitted_at":"2025-04-16T12:16:10Z","title":"Active Human Feedback Collection via Neural Contextual Dueling Bandits"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2504.12016."}