{"as_of":"2026-08-15T23:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef1b96244b96656dcd4aec209d35e33b1f155990d354f49f4b7fde2f1b7455e0","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:20:13.158975Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:57:04.381612Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T19:57:04.556666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"cited_work":{"arxiv_id":"2502.10158","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10158","snapshot_observed_at":"2026-08-07T19:57:04.556666Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","venue":"stat.ML","work_id":"b4f618f1-0124-4198-8cb1-1ba2ddfa8fa5","year":2025},"citing_paper":{"arxiv_id":"2502.10020","last_updated":"2025-06-16T13:10:36Z","snapshot_observed_at":"2026-08-13T08:04:49.895858Z","submitted_at":"2025-02-14T09:01:12Z","title":"Improved Online Confidence Bounds for Multinomial Logistic Bandits","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T19:57:04.381612Z"},"links":{"cited_paper":"/paper/2502.10158","citing_paper":"/paper/2502.10020"},"observation_digest":"sha256:e50d21575be48678cddb375269826e4541f24b3ce6a418fbeef82bed11438025","observation_id":"43b8d225-c795-465e-b2a8-95d9a7baee25","resolution":{"observed_at":"2026-08-07T19:57:04.564210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10158/citation-record","integrity":"/paper/2502.10158/integrity","json":"/paper/2502.10158/citation-record.json","paper":"/paper/2502.10158"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.785181Z","title":"Instance-wise minimax-optimal algorithms for logistic bandits","venue":null,"work_id":"f8f98eba-dcc2-4d0a-860e-7f1e00a5cd05","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.224384Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:3efee26cbdc886b7a2456a4e41c7bc89fe59a5e07b9b862723939e8c8a94e7f7","observation_id":"b18648c4-8d23-482a-b0d4-776f4aea6e69","resolution":{"observed_at":"2026-08-07T19:20:15.791208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.748016Z","title":"Vo q l: Towards optimal regret in model-free rl with nonlinear function approximation","venue":null,"work_id":"486dff9b-48ab-4ac2-b707-a064ed13ce73","year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.231128Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:8f8d7c67d23f5810cce2926050f7c6f9db0861ca4871043a2260bff47a08663b","observation_id":"28165428-c5d9-4984-b1fe-ef7bca76f6de","resolution":{"observed_at":"2026-08-07T19:20:15.761100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.724657Z","title":"A tractable online learning algorithm for the multinomial logit contextual bandit","venue":null,"work_id":"44918aa2-98d4-4e3d-b22f-5a886578b7c6","year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.237577Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:c9da46c96931c21b5beab2de93f6f3504db6f0a631aafd3ed5de50b4588fdf4e","observation_id":"2f556e53-d9b4-478a-93e5-6bad9c169184","resolution":{"observed_at":"2026-08-07T19:20:15.731998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.699709Z","title":"and Goyal, N","venue":null,"work_id":"3fb32cea-6e8c-4ee5-a8e3-7915449a7169","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.245239Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:90b374979de9fff8bc00871046f2c76e3212f2ed0354ba362ab7ccd5a42f35fa","observation_id":"548ffc32-b4db-40e6-afa2-84473a54d7ee","resolution":{"observed_at":"2026-08-07T19:20:15.706758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.674423Z","title":"Thompson sampling for the mnl-bandit","venue":null,"work_id":"4bba03fa-255e-4e69-92d4-353d702cfa90","year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.256779Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:32cb697e7580b2d7dfa125eb72dca50adbadac22258241aa472529db1d205bd6","observation_id":"c5559935-c99c-4704-94fc-f6e73a4e3652","resolution":{"observed_at":"2026-08-07T19:20:15.681536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.645792Z","title":"Mnl-bandit: A dynamic learning approach to assortment selection","venue":null,"work_id":"4479d1ab-4193-4ead-a71a-6cbb96cde221","year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.262831Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a0b9cc795d921e8789f0539c27164f3a4bb992a86179b9558ce342f3ff020859","observation_id":"0080f2ad-5033-432b-92f4-b3169a7009ab","resolution":{"observed_at":"2026-08-07T19:20:15.657502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.271517Z","title":"April: Active preference learning-based reinforcement learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.271517Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f37d6b16c6c51d0d55a6da1e51a6c19231085a51e646385a9422f73f477fc1cf","observation_id":"1a6b6990-e2f1-4953-b1bb-3f9504f68356","resolution":{"observed_at":"2026-08-07T19:20:12.271517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.605021Z","title":"and Thrampoulidis, C","venue":null,"work_id":"61e8b179-9198-46f0-b476-7316cb621955","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.284760Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a28c2ac15f2a13f66cae913098b91ef3d501369655af2bfa1e9d78ed8e94641c","observation_id":"6ce715ec-61b0-468f-9f9a-9d88960490eb","resolution":{"observed_at":"2026-08-07T19:20:15.611297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.579227Z","title":"Distributional off-policy evaluation for slate recommendations","venue":null,"work_id":"3687d985-1b18-4758-9371-532f9c9d48c2","year":2024},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.292863Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:e4cdc2c152d80557aa8f86270a9a7605d00c7a040a089278c83f3cff50000eb2","observation_id":"87e0a6b4-94a7-4b9e-af07-8a22e8837bc7","resolution":{"observed_at":"2026-08-07T19:20:15.587861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.552242Z","title":null,"venue":null,"work_id":"68fcb15d-f1ca-48e9-8a46-0a0cc2da66e6","year":2000},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.304989Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:68a35d1904c898a88a705f5801f78459b132e6ca37cfc1a2a22e84f4fae8ef50","observation_id":"280622c9-3417-4960-854e-bad58b1406bd","resolution":{"observed_at":"2026-08-07T19:20:15.561019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.521773Z","title":"Combinatorial multi-armed bandit: General framework and applications","venue":null,"work_id":"62474f4b-3978-49d2-9e2b-dd01b262b6c1","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.312614Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:d3226b31426ff299dc63f5cffef25ae044e3b1b8d2b15d78b2ad12919787989b","observation_id":"2ba47c7e-b279-4d54-8431-699597d2ea37","resolution":{"observed_at":"2026-08-07T19:20:15.532539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.501286Z","title":null,"venue":null,"work_id":"e6d22ade-2a7b-4b7d-90f3-e76618c927fb","year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.323399Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:afd819d7086fbf519639bf4c6ad2413040a1ab9a9b48fe6cc6e319a0eb85db0b","observation_id":"f373dd7e-7ebb-408d-b664-499d8c7959c3","resolution":{"observed_at":"2026-08-07T19:20:15.507919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.332237Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.332237Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:eafa5a8f1945a9868829df3db7ba1bf80404456f54d8be4e4b30fbf961c4d368","observation_id":"1301a24b-9616-49e4-be44-00e3b0eebef5","resolution":{"observed_at":"2026-08-07T19:20:12.332237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.434228Z","title":"S., Proutiere, A., et al","venue":null,"work_id":"da4cf61d-7fec-4871-9046-fa8809a80b12","year":2015},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.341524Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a878cd700eb1da2ced99da34a48a05735d8d8c3db840b8263a23bbd9d822d562","observation_id":"9f827c34-880e-4eb0-b828-1d6e72e67e0d","resolution":{"observed_at":"2026-08-07T19:20:15.443014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.397206Z","title":null,"venue":null,"work_id":"f2c6213e-9b9b-4aa8-ac36-1d82e033689a","year":1962},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.352173Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:d8ea1d90987e1d7b5106a6f52e93cbf7ff6644397223ab8000a36a695dbda425","observation_id":"f486ebc0-5827-49a4-b03e-e77ade3febf1","resolution":{"observed_at":"2026-08-07T19:20:15.415420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.366805Z","title":"Assortment planning under the multinomial logit model with totally unimodular constraint structures","venue":null,"work_id":"66a747cc-1435-4b3b-b4f4-a3b165d8f1c9","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.359505Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:3348c41f4fbad42bac6858d3ff3873cbd052300c656c5a14c587879b6ef85314","observation_id":"6efd8f5d-8ecd-4f79-a205-07b39d9a6b00","resolution":{"observed_at":"2026-08-07T19:20:15.383925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.329535Z","title":"Reinforcement learning with combinatorial actions: An application to vehicle routing","venue":null,"work_id":"d725c2f8-bc53-4d8f-bc5e-f94331548142","year":2020},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.365124Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:50f0bd80f2c3f606e5c443b6ebc9d0a406b220e96f41b309da021c709fa1305f","observation_id":"d28026fd-a4ba-4d6e-99d7-21851d4eb11f","resolution":{"observed_at":"2026-08-07T19:20:15.337692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.307973Z","title":"Bilinear classes: A structural framework for provable generalization in rl","venue":null,"work_id":"bd51e001-1428-40ef-97eb-efb1b85e101e","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.371484Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a37a9e081811dfa3561ddbff9fefad2f6deb99efac9fe6c67f993ba6fb95e73d","observation_id":"dfac6861-d89d-44c1-9e18-c0cfc3117ede","resolution":{"observed_at":"2026-08-07T19:20:15.314252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08961","last_updated":"2024-04-07T05:29:24Z","snapshot_observed_at":"2026-08-13T04:40:54.420933Z","submitted_at":"2024-01-17T04:20:26Z","title":"Cascading Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2401.08961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08961","snapshot_observed_at":"2026-08-07T19:20:13.841407Z","title":"Cascading Reinforcement Learning","venue":"cs.LG","work_id":"a6b61ff3-ec33-401f-8ebc-ca144bacb1ad","year":2024},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.377776Z"},"links":{"cited_paper":"/paper/2401.08961","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:4e9641150f8f57854e113a05301893717d83d004c65b67fac2ecf1efe9ce1d66","observation_id":"ac33eec9-1542-41d9-aa9a-81687450b21a","resolution":{"observed_at":"2026-08-07T19:20:13.850736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.405443Z","title":"Improved optimistic algorithms for logistic bandits","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.405443Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:0ec2890e49be92fb81773f652f38a8f0880942dd4d669f35df77bec4303f7ac8","observation_id":"cfa91a6f-ffe0-4abc-946c-00885a286f88","resolution":{"observed_at":"2026-08-07T19:20:12.405443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.259863Z","title":"Jointly efficient and optimal algorithms for logistic bandits","venue":null,"work_id":"cd0d5d71-a825-4db0-92fe-788f2dd0937d","year":2022},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.475614Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:7b0318108575e3b3cb7d3dd7d387e2bf71b831f3a05a9475d7973a6e4e028e35","observation_id":"098c220a-6abd-4050-b907-6c19d2a35cb0","resolution":{"observed_at":"2026-08-07T19:20:15.269061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.237249Z","title":"Parametric bandits: The generalized linear case","venue":null,"work_id":"3b912abe-7890-4b71-a627-41d8d9fe1dc6","year":2010},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.546882Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:484613b03f9038cde2d3ce29f9decb95f1b9c2dea551ff4ba0b019464be0eae5","observation_id":"7e340fbd-91da-4e35-ba4b-b239c9866093","resolution":{"observed_at":"2026-08-07T19:20:15.243063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13487","last_updated":"2023-07-11T16:47:42Z","snapshot_observed_at":"2026-08-13T17:08:25.517069Z","submitted_at":"2021-12-27T02:53:44Z","title":"The Statistical Complexity of Interactive Decision Making","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13487","snapshot_observed_at":"2026-08-07T19:20:12.598167Z","title":"J., Kakade, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.598167Z"},"links":{"cited_paper":"/paper/2112.13487","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:8a264de9e80c2fc7f1f25551cbd70a3126a3add6bd3a268950433973a843505a","observation_id":"2f8a65c8-fb8b-4f3f-8849-0f9032f82e28","resolution":{"observed_at":"2026-08-07T19:20:12.598167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.212233Z","title":null,"venue":null,"work_id":"62ec14e4-7c21-4a75-b92c-549100bfd109","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.655974Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a49d0ff1415705e415ef1fa7c8b2e7132fd11bf2f8099ab556de934803c210cd","observation_id":"c03b3cd5-d973-41bd-a51c-8dfa139917cd","resolution":{"observed_at":"2026-08-07T19:20:15.218068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03667","last_updated":"2016-09-17T00:52:43Z","snapshot_observed_at":"2026-08-14T21:53:09.573955Z","submitted_at":"2016-06-12T05:38:20Z","title":"Deep Reinforcement Learning with a Combinatorial Action Space for Predicting Popular Reddit Threads","version":4},"cited_work":{"arxiv_id":"1606.03667","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.03667","snapshot_observed_at":"2026-08-07T19:20:13.714767Z","title":"Deep Reinforcement Learning with a Combinatorial Action Space for Predicting Popular Reddit Threads","venue":"cs.CL","work_id":"25986f11-2183-4ad0-80b2-271c554d260f","year":2016},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.665758Z"},"links":{"cited_paper":"/paper/1606.03667","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f16657a1aa0ee40e82ea47f161a53b1e81e77571d972822270f2a646f5e61abe","observation_id":"6928cb0d-781e-413a-8e6e-441d96001d7d","resolution":{"observed_at":"2026-08-07T19:20:13.748595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.190093Z","title":"Slateq: A tractable decomposition for reinforcement learning with recommendation sets","venue":null,"work_id":"02d28674-7535-4e88-a532-758f764d8168","year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.672769Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:9e1c68b0e7ec54a8deed0d4eaecb8c20d9ad78e138e482b7f9cdacc76c6d2627","observation_id":"3d67be2f-445b-4ee9-8b72-fb62b692493b","resolution":{"observed_at":"2026-08-07T19:20:15.197624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.155608Z","title":"Randomized exploration in reinforcement learning with general value function approximation","venue":null,"work_id":"e4d66ac6-0cbc-47f3-b586-daa196d6c035","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.680375Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:ca81c3090d7b707ea21f5956102d968f5d1487296cb1dd9c1b8e7bdf3f3a2079","observation_id":"db054e73-4680-4d27-87cf-20070c8075d5","resolution":{"observed_at":"2026-08-07T19:20:15.166195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.125692Z","title":null,"venue":null,"work_id":"97286c1b-a3d3-49ec-8a1a-c44fbd81a016","year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.685870Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:fdca1c2ba64da9f29931e94562bdab5481d0444dbc636c92368792a283e76428","observation_id":"d37ac1b4-fda5-476f-a172-b224f7503961","resolution":{"observed_at":"2026-08-07T19:20:15.133885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.092102Z","title":null,"venue":null,"work_id":"ca01a623-f17a-45b4-b0c5-911323cb3e67","year":2018},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.692642Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:1470f62d7100d91abf233174004884316a22805e82d8755724fac5493dad1e14","observation_id":"eb345469-8408-4da7-ab13-a4e73fec3f43","resolution":{"observed_at":"2026-08-07T19:20:15.102859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.070028Z","title":null,"venue":null,"work_id":"00993a8a-d2d3-4c69-8abb-ed9818166247","year":2020},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.699888Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:398fdf6df2ba84b9c4d0d54cb277f6961cf324950da48231acaabb994568d2f5","observation_id":"768a359f-e859-454d-8b5d-64a5cc65c0f9","resolution":{"observed_at":"2026-08-07T19:20:15.076408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.045487Z","title":"Bellman eluder dimension: New rich classes of rl problems, and sample-efficient algorithms","venue":null,"work_id":"db430d82-cf20-4e9a-84b2-e81504932651","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.705775Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:aa82e96a3bb345ef23576c9188db77f2d5d70256dcae342171d2b972ea60e62f","observation_id":"20505fb5-e7b5-4bb6-bba8-f729ebe59dd9","resolution":{"observed_at":"2026-08-07T19:20:15.053824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07203","last_updated":"2023-04-18T12:57:43Z","snapshot_observed_at":"2026-08-13T19:04:21.662141Z","submitted_at":"2021-06-14T07:36:25Z","title":"Online Sub-Sampling for Reinforcement Learning with General Function Approximation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07203","snapshot_observed_at":"2026-08-07T19:20:12.711779Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.711779Z"},"links":{"cited_paper":"/paper/2106.07203","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:1e435f602b9a1a036ddd0e03cd032d5bf8ffb2bbb08b953d82c58a56733dcd41","observation_id":"c7559e90-d365-4d5d-887e-5c33a19d1edf","resolution":{"observed_at":"2026-08-07T19:20:12.711779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.008764Z","title":"Cascading bandits: Learning to rank in the cascade model","venue":null,"work_id":"170df7f6-453d-4ed9-b905-2742806e87dd","year":2015},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.717594Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f3c580faa6f1e18cd6f7c6b73d96d6fe0b18825a60e8892992bd2d47e58b62d4","observation_id":"e51f6d31-7122-487c-b078-3f5864f46902","resolution":{"observed_at":"2026-08-07T19:20:15.022919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.985146Z","title":"Combinatorial cascading bandits","venue":null,"work_id":"4b51a430-a379-4e1f-8b70-71b8328e737e","year":2015},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.722642Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:51c2a17b28acfc35fb07146f6839e8b9803c711247a87c55b4dacb992087de55","observation_id":"97c5c92f-6b79-4add-a98d-4cb47ffe6888","resolution":{"observed_at":"2026-08-07T19:20:14.990933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.962901Z","title":"and Hutter, M","venue":null,"work_id":"522d6d6e-ac78-4c40-9a61-a6c7dd5e0b5c","year":2012},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.727018Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:532584c6238ff3dfc93fb2363426371035193fb84f46720440cc367e27808e62","observation_id":"a616e48a-f068-49d1-b623-93d9fbe07a2e","resolution":{"observed_at":"2026-08-07T19:20:14.969336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.940973Z","title":"and Oh, M.-h","venue":null,"work_id":"2ce13301-0976-410c-b387-6e958248c765","year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.732283Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a4d4541b141c48b8544b9506bf7878f23b7f7a1efcb80dabb233d72b957855d1","observation_id":"1d65c601-5eb0-47a9-a4f8-b27ae658b390","resolution":{"observed_at":"2026-08-07T19:20:14.946498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.914596Z","title":"and Oh, M.-h","venue":null,"work_id":"6acae787-1d16-495e-8054-eb58947a1f76","year":2024},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.736731Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:8fae78cb2fb3f377e21a31938648b95a7fcb87ce95e9b19f94d621d0c14ae1b4","observation_id":"28b636af-c5f1-4f43-896a-d20548e80e13","resolution":{"observed_at":"2026-08-07T19:20:14.921457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.741426Z","title":"Online learning to rank with features","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.741426Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:503a90d5c21ca21f3973c15fd1ce9d975fbcf561e6cb593cea21a43e5d1b3b20","observation_id":"aabc5773-222e-482b-97a6-cc8434b97888","resolution":{"observed_at":"2026-08-07T19:20:12.741426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.860807Z","title":"Modelling the choice of residential location","venue":null,"work_id":"933e8d32-1bcc-497d-9cb8-fd415675ec68","year":1977},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.747449Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:97833f1d1b28e066ca23ce026dee0469c27fb82da38ca199ce1f46a77e10cb20","observation_id":"2e7da764-f091-4cd8-8af8-a1b6b9e12d03","resolution":{"observed_at":"2026-08-07T19:20:14.869998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.839300Z","title":"Counterfactual evaluation of slate recommendations with sequential reward interactions","venue":null,"work_id":"5240ee1f-da63-44f7-a7e1-3bca8272274b","year":2020},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.754104Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f4212b8a31bed47545783420fd12f109d356ee8ae14726b7ddc8525531653ed6","observation_id":"7ea4aeb3-84a7-439d-8dd2-8f0fb9d3985f","resolution":{"observed_at":"2026-08-07T19:20:14.846788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.05035","last_updated":"2019-06-08T00:56:16Z","snapshot_observed_at":"2026-08-14T21:00:48.813378Z","submitted_at":"2017-05-14T22:53:13Z","title":"Discrete Sequential Prediction of Continuous Actions for Deep RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.05035","snapshot_observed_at":"2026-08-07T19:20:12.761945Z","title":"Discrete sequential prediction of continuous actions for deep rl","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.761945Z"},"links":{"cited_paper":"/paper/1705.05035","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:3a60fb41243701f5f10e4f2a21811c60af671cca0d7aaecce9defa9afe84f040","observation_id":"fcfff1cd-f4ab-4158-ae4a-b06c3f79319c","resolution":{"observed_at":"2026-08-07T19:20:12.761945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.814637Z","title":"M., and Van Erven, T","venue":null,"work_id":"cfe5f21f-47d0-449b-977b-867b91e44116","year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.792670Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:c72939b9058d2e082c26f572a1d30c99f8adbd47adbfcf8f42dd2924fb5b4225","observation_id":"f28ccee3-682d-4983-af4c-fc167647d0c5","resolution":{"observed_at":"2026-08-07T19:20:14.823133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.790913Z","title":"and Iyengar, G","venue":null,"work_id":"07ccc7c5-b7b2-471c-9a7d-5eda18a7d421","year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.825505Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:3cdf55256e5144f1ed8d8a93747fc44bd0c576fdcba5864149894a5e02c4ade4","observation_id":"56c2cf88-add8-4503-afae-f42231ec6f72","resolution":{"observed_at":"2026-08-07T19:20:14.798459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.770403Z","title":"and Iyengar, G","venue":null,"work_id":"eb245a4d-c16d-4e1c-9f9d-183beb71bf70","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.844502Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a89fc7fb960c13b738a2e310a009a37d0370e62266750b9e2c3c239ae15eb5b8","observation_id":"817c122c-11e5-4d5e-a8d0-f173f9c3e92f","resolution":{"observed_at":"2026-08-07T19:20:14.776371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13213","last_updated":"2026-06-21T08:13:27Z","snapshot_observed_at":"2026-08-15T05:32:55.984958Z","submitted_at":"2019-12-31T08:16:31Z","title":"Online Learning: A Modern Introduction Using Convex Optimization","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13213","snapshot_observed_at":"2026-08-07T19:20:12.870065Z","title":"A modern introduction to online learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.870065Z"},"links":{"cited_paper":"/paper/1912.13213","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:ff0b1285b03341612fe659c6f3ff869e641a41ad4631fe5791ff1db6c1c5261a","observation_id":"5709ed03-ef9c-4ebf-8579-29b622ec9063","resolution":{"observed_at":"2026-08-07T19:20:12.870065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.896163Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.896163Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a6de84d5d1c559afe6739174706c452760ea5400c17c0f8f66bdedb0de1bc507","observation_id":"71557d63-5f85-40df-aeba-389f1c2d1a42","resolution":{"observed_at":"2026-08-07T19:20:12.896163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.718056Z","title":"and Goyal, V","venue":null,"work_id":"68a769e2-3246-47ac-ad41-ed322b13ce95","year":2022},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.904201Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:35696209d2d5186f489b9bcd1a5185b0e4f993eefe92ae2be7f7c924800e35de","observation_id":"b44bb0a4-8212-49ba-821f-f13f5e3bc851","resolution":{"observed_at":"2026-08-07T19:20:14.725451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.695448Z","title":"M., and Shmoys, D","venue":null,"work_id":"08d9d978-2e77-430f-ae55-ca4bab984052","year":2010},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.910945Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:892899b0996e04d18f362804716be7bb163fe76d739d141525bff78fbd48e28f","observation_id":"a975f62f-39bd-43ad-aa70-cfa62807d193","resolution":{"observed_at":"2026-08-07T19:20:14.702565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.639732Z","title":"and Van Roy, B","venue":null,"work_id":"118843e9-02de-4499-8542-df1b544b9fef","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.918859Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:ee121c302d710c4d4c84e01f2aee599a78abab46b1883895be6a296e06813a67","observation_id":"fd73fb0f-6618-47e3-8b24-2fa8b5fc3fcd","resolution":{"observed_at":"2026-08-07T19:20:14.674460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12397","last_updated":"2020-02-28T19:29:14Z","snapshot_observed_at":"2026-08-09T17:07:25.463528Z","submitted_at":"2019-09-26T21:16:17Z","title":"CAQL: Continuous Action Q-Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12397","snapshot_observed_at":"2026-08-07T19:20:12.926888Z","title":"Caql: Continuous action q-learning","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.926888Z"},"links":{"cited_paper":"/paper/1909.12397","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:2e9b82e1d99885a242ebcc6132b61582368df2e135cd8ea6e261b943365f0d74","observation_id":"3b9cb725-dbc2-4f30-886e-b86fde07259b","resolution":{"observed_at":"2026-08-07T19:20:12.926888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.934451Z","title":"Dueling rl: Reinforcement learning with trajectory preferences","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.934451Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:785c74981efb2bb6ce3b86f934bdd2d3da6102bc6ed5e8bff1f199ece13cadde","observation_id":"c361c8e7-8103-4598-9c9c-54a000858ecd","resolution":{"observed_at":"2026-08-07T19:20:12.934451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.522121Z","title":"and Zeevi, A","venue":null,"work_id":"2474c291-067e-4381-8b92-e54f83ae26f7","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.943188Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:2457c1ca387bffd61f7eb7a1c6f5c2faef0e20211d400119e451bef71857f4d6","observation_id":"0f14d212-1104-4eb3-a749-0100b3ac460c","resolution":{"observed_at":"2026-08-07T19:20:14.571717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.01124","last_updated":"2015-12-16T17:34:55Z","snapshot_observed_at":"2026-08-14T22:20:08.722879Z","submitted_at":"2015-12-03T15:51:30Z","title":"Deep Reinforcement Learning with Attention for Slate Markov Decision Processes with High-Dimensional States and Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.01124","snapshot_observed_at":"2026-08-07T19:20:12.951927Z","title":"Deep reinforcement learning with attention for slate markov decision processes with high-dimensional states and actions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.951927Z"},"links":{"cited_paper":"/paper/1512.01124","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:21d69ddf21222beaf17a4420c3ea9415014f9cc1a223bda598a4b91011f51c21","observation_id":"e54c55dc-8a4a-4da0-b233-80cb91fa2068","resolution":{"observed_at":"2026-08-07T19:20:12.951927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.440291Z","title":"Off-policy evaluation for slate recommendation","venue":null,"work_id":"ffac5342-48e2-4279-9cc2-40ea72039666","year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.958603Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:17f454793c17875e8c1b4e9fe61f4f092e9daa081f89de01117fb5ba680a7ddb","observation_id":"2d6c0153-9fd0-48af-aeb0-753d3caa5d61","resolution":{"observed_at":"2026-08-07T19:20:14.490085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.385836Z","title":"Composite convex minimization involving self-concordant-like cost functions","venue":null,"work_id":"5b634974-57ba-4007-8094-6e4e7e897fa9","year":2015},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.967403Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f40ab6bdc611d19444c5333100a9a9e6c79a4351a6adca8a2749db6b418c0cd9","observation_id":"966e96de-4d75-4ed4-a76e-7b8f27233eb2","resolution":{"observed_at":"2026-08-07T19:20:14.392696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.363792Z","title":"Control variates for slate off-policy evaluation","venue":null,"work_id":"75bfcee1-eca5-4f9b-9223-a6981e2f7c36","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.973733Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:764255a563b5e6f12d147d3358b58a4d1bd3411d14e54487f895f47eb3487f74","observation_id":"0381e4e0-bdaa-41eb-8fd2-05ade2ab0bc1","resolution":{"observed_at":"2026-08-07T19:20:14.370807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.335470Z","title":"R., and Yang, L","venue":null,"work_id":"588c13d3-fc83-4589-b519-89c8b3f20276","year":2020},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.979355Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:16f2d90031cc7ea15d71b7455c193a2a83f36a5371a6adea342b18138eeb8fe9","observation_id":"94a32340-6a5b-4085-bb4e-f7ca283eb595","resolution":{"observed_at":"2026-08-07T19:20:14.343071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.293523Z","title":"S., and Krishnamurthy, A","venue":null,"work_id":"5144f22c-f563-476a-82d1-9eb81aa6b9bc","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.984567Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:ee9d9787e1330405e90f96ca762d48ebfe45a1aa648772c2f02fe23d87a36e6e","observation_id":"cf765a08-75ae-4f55-8dba-ffcf813dc963","resolution":{"observed_at":"2026-08-07T19:20:14.299861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.992315Z","title":"A survey of preference-based reinforcement learning methods","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.992315Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:26a03adcfec0ff57da39f4797a6e4954c75e9ec0dafb1e4320d98abcea103493","observation_id":"f7cfa02b-79b3-4be3-9004-935ad45b2f17","resolution":{"observed_at":"2026-08-07T19:20:12.992315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.243590Z","title":"and Wang, M","venue":null,"work_id":"5f1cfcd4-15fb-4674-a51c-ba6b45269a74","year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.998266Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:65cac46e509d3251add7508afab52178bb9bac76b64f8b3cd0ac3b2cb3168b1b","observation_id":"709c594c-281b-4b1f-b016-6bb1a69643b8","resolution":{"observed_at":"2026-08-07T19:20:14.250244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-08-14T10:44:07.592937Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-07T19:20:13.002840Z","title":"D., and Sun, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.002840Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:81ac781a9a69dcb0d372168c584b3c33ac4c525432d18ebdfcb7ab9b1d2eb44d","observation_id":"ba8ba420-fd18-4f34-b324-9b965813f310","resolution":{"observed_at":"2026-08-07T19:20:13.002840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.218098Z","title":"and Sugiyama, M","venue":null,"work_id":"59802bf9-da3c-45d9-8da6-ec05192fa578","year":2024},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.009631Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:e4704e1ddda52c5dc031366f28dc02e7de92f082080c4fd16ddb0dca8b74ed3b","observation_id":"304bad2e-afe8-4a0c-86ac-823bd00b71a0","resolution":{"observed_at":"2026-08-07T19:20:14.224992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:13.024732Z","title":"A nearly optimal and low-switching algorithm for reinforcement learning with general function approximation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.024732Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:1abf6d2404a1160ddc5700f5a34133d2d78e84cac1be4c197065761f50c70143","observation_id":"b2ccb11c-209a-402c-ae20-0d9270cbc34b","resolution":{"observed_at":"2026-08-07T19:20:13.024732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.101687Z","title":"Nearly minimax optimal reinforcement learning for linear mixture markov decision processes","venue":null,"work_id":"a5841229-18c9-4425-bde2-44328f83c4f3","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.054874Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:ea4ffc318b94390485b1ae76aac1e1997744cd60ede2b28f47718b48cf93e7c6","observation_id":"61a64b14-a5d7-4c2d-91d6-8eb528de124a","resolution":{"observed_at":"2026-08-07T19:20:14.158264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.000373Z","title":"Provably efficient reinforcement learning for discounted mdps with feature mapping","venue":null,"work_id":"e2607484-692e-4a66-bb86-1dce9804935f","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.080977Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:eb0ae1ca307a6c05b63668618b65c032782db0a945d417383ece99f51bf160e8","observation_id":"b708c4e8-4c11-4f98-97b7-749ec3e6d313","resolution":{"observed_at":"2026-08-07T19:20:14.048206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:13.883217Z","title":"Principled reinforcement learning with human feedback from pairwise or k-wise comparisons","venue":null,"work_id":"204581a5-e349-414e-a5cc-4279515b8f3f","year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.108373Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:df4636b349558988e280dc777090e9a502316fd00c33953f566596a95974dc1a","observation_id":"1d0be506-c88f-4589-a7c3-2ea55a333c73","resolution":{"observed_at":"2026-08-07T19:20:13.941327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:13.158975Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.158975Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:62fbe0709e63ed0b614866e0147e2c86ff52719d485a06161627903befa645c9","observation_id":"f862ff19-2f46-4f8b-b608-2e8bc716e90a","resolution":{"observed_at":"2026-08-07T19:20:13.158975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","latest_version":3,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-12T15:11:45.539275Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":42},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 1 inbound Pith citation observation for arXiv:2502.10158."}