{"as_of":"2026-08-14T02:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24e249ab6a38a68638f2cb9d93b1e03fc5daec363db46664d87e50594f797e02","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:43:58.594829Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12786/citation-record","integrity":"/paper/2411.12786/integrity","json":"/paper/2411.12786/citation-record.json","paper":"/paper/2411.12786"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.252471Z","title":"Eﬀective evaluation using logged bandit feedback from multiple loggers","venue":null,"work_id":"bb70ade3-c9c3-420d-85ae-22ec9af4a21f","year":2017},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.384377Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:e67873caf38335c6afa9227167e49caaafd8715008ebdd208fa73e09f5561fdb","observation_id":"bdd83350-4a3f-4855-a636-79ceb0361447","resolution":{"observed_at":"2026-08-12T17:43:59.256076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.388449Z","title":"Thompson sampling for contextu al bandits with linear payoﬀs","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.388449Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:b512d580ba95822fd7ca4cc6dd71e9e872cc7aad792c61d733a03259c2c789e9","observation_id":"13ea1470-4f55-4404-8e50-78c360375fc7","resolution":{"observed_at":"2026-08-12T17:43:58.388449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.237355Z","title":"Finite-sample optimal e stimation and inference on average treatment eﬀects under unconfoundedness","venue":null,"work_id":"2f8ad981-afd2-409b-8688-22f6b16ac133","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.391895Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:480ca30fb35950109d7be13549348853d9992ccb719865c4c542c91743be77ff","observation_id":"ce097e39-82ee-4281-b98d-a34f8d4f4eef","resolution":{"observed_at":"2026-08-12T17:43:59.240714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.227285Z","title":"Counter factual reasoning and learning systems: The example of computational advertising","venue":null,"work_id":"d23e989d-94cf-4298-b28e-5322ba2e2dfb","year":2013},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.395022Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:9c199cbee148ca678710c66931a8e08195b9c0ef3b60d67bdbc77e6c03e24349","observation_id":"8bf30fc0-a75e-412b-bc2b-87bb306bf313","resolution":{"observed_at":"2026-08-12T17:43:59.230750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.217916Z","title":"Double/debiased/neyman machine learning of treatment eﬀ ects","venue":null,"work_id":"8819fd17-bd90-41ab-9863-1e3d370e7430","year":2017},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.397978Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:6a11369cf3f143d6f11112b880a2ffe6ded4ed0be34c7c89ffe7dad3ab2f6a5b","observation_id":"fd40c365-92ad-4ac5-bbc8-19596f448401","resolution":{"observed_at":"2026-08-12T17:43:59.221129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.208757Z","title":"Double/debiased machine learning for tre atment and structural parameters, 2018","venue":null,"work_id":"b4a5fd8b-0a2c-4f8c-9729-6fd9a5167146","year":2018},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.401013Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:d1d3e36814c6dab39d92dcc87142b82c15ce0965560cddc68562ba076bee71e1","observation_id":"e32cfe94-d42a-41ad-9186-b6f943c93bf2","resolution":{"observed_at":"2026-08-12T17:43:59.212056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.199462Z","title":"Semiparametric e ﬃcient inference in adaptive experiments","venue":null,"work_id":"43b0e378-ae96-45cf-b98b-08ee9cb9203a","year":2024},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.404140Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:7dba5eaf452a96fb26090e07892d5078d1a0434eddb870589610381b6483750a","observation_id":"2e61cfd6-12a8-4a77-a4c6-12f39503cd48","resolution":{"observed_at":"2026-08-12T17:43:59.202829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.190476Z","title":"Clip-ogd: An experimental design for adaptive neyman allocation in sequential experiments","venue":null,"work_id":"4cb0e4f5-7265-423d-80c8-be9a31cda277","year":2024},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.406886Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:72a4fa57fc167b126344e24325ab3d0254b15859b7d530a1898a5e2f64cb10ca","observation_id":"491d4f36-c436-434a-a1b3-0c90b1b30727","resolution":{"observed_at":"2026-08-12T17:43:59.193720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.180957Z","title":"Do ubly Robust Policy Evaluation and Optimization","venue":null,"work_id":"5a2019b0-b364-452c-84aa-48bd5a436231","year":2014},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.409474Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:c3a49405db2a54accb08d05c217e171c784ca1c19c171ffce64758e5b8c9ba39","observation_id":"dfdd3bd8-5e89-4030-b644-7e841cfa0b74","resolution":{"observed_at":"2026-08-12T17:43:59.184495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1103.4601","last_updated":"2011-05-06T02:38:18Z","snapshot_observed_at":"2026-08-10T15:57:17.735739Z","submitted_at":"2011-03-23T19:37:45Z","title":"Doubly Robust Policy Evaluation and Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1103.4601","snapshot_observed_at":"2026-08-12T17:43:58.412086Z","title":"Doubly robust po licy evaluation and learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.412086Z"},"links":{"cited_paper":"/paper/1103.4601","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:ff5660e72d45c1e7739966cb68995c1b82a21b07058f7d6098a06c62c775c680","observation_id":"dff7eb14-9d79-402b-ad90-bf38a1f04644","resolution":{"observed_at":"2026-08-12T17:43:58.412086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.172561Z","title":"Overlap in observational studies with high-dimensional covariates","venue":null,"work_id":"786e666d-6b57-432d-aa2d-b8bcff78999f","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.415711Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:155b8a44f04a172a0a29b9b7406f7a25309ed39182b9df2050b68ddaf98ff75e","observation_id":"7d9430af-0516-438e-bd0d-a37e3f968b60","resolution":{"observed_at":"2026-08-12T17:43:59.175673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.163852Z","title":"More robust doubly robust oﬀ- policy evaluation","venue":null,"work_id":"a256ff60-6b3b-4685-bad2-3a1e3329fd6e","year":2018},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.419407Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:74dcb933597fa4a6a185b75a83320674567e1bacf8d00ac248fae51b3dfce5c8","observation_id":"2b0c36a5-6efe-4731-b99e-726bed0c03d4","resolution":{"observed_at":"2026-08-12T17:43:59.166818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.154217Z","title":"Oﬀ-policy evalua- tion with deﬁcient support using side information","venue":null,"work_id":"02668f05-2dda-430f-8886-d0a6722a1dc7","year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.422621Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:6371ac8677748fa66d4936ef3191a8865d4f9c89ddca4e875b2448af78206905","observation_id":"a62be84f-d5b7-47bf-ae67-fe25208a1530","resolution":{"observed_at":"2026-08-12T17:43:59.157620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.145036Z","title":"On choosing and bounding pr obability metrics","venue":null,"work_id":"5977551d-6571-4838-b6ed-d43a5ec6ba41","year":2002},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.425943Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:c986b6ff4769cd315ff7e4722b24e3d8830cf066ca76418ebf7a02ca4335d935","observation_id":"42f631f7-b5c5-4b08-ba6e-5e56dd33b700","resolution":{"observed_at":"2026-08-12T17:43:59.148297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.135615Z","title":"Some limit theorems for empirical pro cesses","venue":null,"work_id":"892cf651-5d05-4408-a6ee-cf9ee087f395","year":1984},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.429094Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:742c88532b7a7fe160f8a935883c59869f65dc27f308bdeee9f945e6a9efa31a","observation_id":"4efef9cc-4459-402c-82b4-b956e067a7e3","resolution":{"observed_at":"2026-08-12T17:43:59.138932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02768","last_updated":"2021-02-12T20:03:50Z","snapshot_observed_at":"2026-08-11T14:33:21.579861Z","submitted_at":"2019-11-07T06:15:52Z","title":"Confidence Intervals for Policy Evaluation in Adaptive Experiments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02768","snapshot_observed_at":"2026-08-12T17:43:58.432460Z","title":"Conﬁdence intervals for policy evaluation in adaptive experiments.” arxiv e-prints","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.432460Z"},"links":{"cited_paper":"/paper/1911.02768","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:a324119f53268e3765c3fbd7afd5278221fa242b8269d5b6741eb3c6f7489cd8","observation_id":"41617ce4-8cec-4cd5-a09a-1744a5b61858","resolution":{"observed_at":"2026-08-12T17:43:58.432460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.125395Z","title":"Conﬁdence inter- vals for policy evaluation in adaptive experiments","venue":null,"work_id":"733361b0-b873-45a6-99db-2a0f1231c794","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.436031Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:318e3015a57f4e04fa779e9f81610df1df17ec3aaf87e430e77f153bd045bd13","observation_id":"0766f0a5-fa30-4f30-a69c-f9b62ed2d9d7","resolution":{"observed_at":"2026-08-12T17:43:59.129076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.115839Z","title":"Introduction to online convex optimization","venue":null,"work_id":"8047406d-ff48-4eed-ab58-89597cb43568","year":2016},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.439220Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:ebc28438464e06739ef444f53a7ed19bd9c61d550de9fe7ac2b10be3ba4c2d84","observation_id":"692f9d41-76df-4b6a-a04a-de2cafda0a08","resolution":{"observed_at":"2026-08-12T17:43:59.119387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.106209Z","title":"Weighted average importance sampling and def ensive mixture distributions","venue":null,"work_id":"65fe94f3-0e09-4c50-9872-8fd646c1d4f8","year":1995},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.442438Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:a835f9b37de24e0803aa352fdb376e213397b8b314e28c8e36dbdab43a9eccb5","observation_id":"51e107c3-03f6-491f-bbdb-60360cedec4b","resolution":{"observed_at":"2026-08-12T17:43:59.109820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.097142Z","title":"Eﬃcient estim ation of average treatment eﬀects using the estimated propensity score","venue":null,"work_id":"fa1df206-6ce5-4b18-9dda-a4ce41d5df3c","year":2003},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.445622Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:1e49e189091bdf38a11bfd568f018c236f14779819c4d66854be3d4e6d8d449b","observation_id":"fddd75ce-9f02-4eaa-b5f8-1d1e2d9534fe","resolution":{"observed_at":"2026-08-12T17:43:59.100505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.087737Z","title":"A generalization of sa mpling without replacement from a ﬁnite universe","venue":null,"work_id":"face0fdf-495e-4bb2-a7fe-40b465d2f7ca","year":1952},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.448907Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:7b8d86034f940bcca258ac74058ce1899412bb2435edce1815e3bb43d67177ce","observation_id":"ff2cfef6-8ffe-4454-9e4f-cef40093e66d","resolution":{"observed_at":"2026-08-12T17:43:59.091187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.077460Z","title":"Howard, Aaditya Ramdas, Jon McAuliﬀe, and Jasjeet Sekhon","venue":null,"work_id":"63c6d814-6837-47af-a253-c1e20a6e4d9b","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.452186Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:eb1ab1c3a784ccde0111725b70d99968dea86e0aacd7d973e8fd6c4080d2c1b5","observation_id":"765d4f6a-cc66-4f1b-98c3-af5a1bfbf90c","resolution":{"observed_at":"2026-08-12T17:43:59.080484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.068384Z","title":"Nonparametric estimation of average treatme nt eﬀects under exogeneity: A review","venue":null,"work_id":"9b0fcf38-1ddd-406d-8ad9-12d2f11ac07b","year":2004},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.455371Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:2ab86bda0d2a319d0c8cb3a4dc9f8013db6074fef3883f35a7106bda16105ddc","observation_id":"42d8ad55-67c2-44d3-b7e5-37b9018e7402","resolution":{"observed_at":"2026-08-12T17:43:59.071509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.059669Z","title":"Causal inference in statistics, social, and biomedical sci ences","venue":null,"work_id":"80ab9f08-c3ad-4ee4-b9bf-aecb63a77965","year":2015},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.458429Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:2a020fd409b88e56712d773c9c55d9c6c8a4d2c597bba25fa7708310b533b395","observation_id":"ab7db0ae-314d-4100-bf24-ca9e988eb639","resolution":{"observed_at":"2026-08-12T17:43:59.062808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.050659Z","title":"Truncated importance sampling","venue":null,"work_id":"0511d83d-c634-416c-8fab-b04d414de587","year":2008},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.461628Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:cd4c2aeb95444c36724dd531b38a919d32caea1cce6c44f6f2f58d587d020093","observation_id":"54c95186-535e-4c35-b68f-a97bb9c66e74","resolution":{"observed_at":"2026-08-12T17:43:59.053695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09900","last_updated":"2025-06-05T01:50:31Z","snapshot_observed_at":"2026-08-13T13:18:35.409457Z","submitted_at":"2022-12-19T22:43:08Z","title":"Policy learning \"without\" overlap: Pessimism and generalized empirical Bernstein's inequality","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09900","snapshot_observed_at":"2026-08-12T17:43:58.464904Z","title":"Policy lea rning” without”overlap: Pessimism and generalized empirical bernstein’s inequality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.464904Z"},"links":{"cited_paper":"/paper/2212.09900","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:c4d7a9b4858564c9683bc46dcfd98ef81ba1f2b194ee36cd3ed2e0a74944e4fa","observation_id":"33ecec2d-451b-42fb-8475-e8cb28bee0c2","resolution":{"observed_at":"2026-08-12T17:43:58.464904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.041085Z","title":"Optimal oﬀ- policy evaluation from multiple logging policies","venue":null,"work_id":"41506064-9283-4b27-a79a-60a2f800a9bc","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.468517Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:4b45f38b12d80c90c6000439b5a9795c6aac241b9937b7178bd76b83cce050fc","observation_id":"73586c0e-5b7c-464f-9f2b-1fd543b59673","resolution":{"observed_at":"2026-08-12T17:43:59.044609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.031004Z","title":"Policy evaluation and optimization w ith continuous treatments","venue":null,"work_id":"cebf13fe-dc82-40f7-b70d-f21f59423544","year":2018},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.471851Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:711b88fd4651513db4348febe47a9d50ffb0c7c3dccaa21e10b90092af8d47da","observation_id":"1415e787-1b6c-4ec2-8a14-6cd007dc1bf8","resolution":{"observed_at":"2026-08-12T17:43:59.034761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.021572Z","title":null,"venue":null,"work_id":"3021a783-4d19-48c6-85a0-02adb2a0dea5","year":2007},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.474877Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:9b20b17bdc6d29e23de52582129eefa9cbb84b2388d10908524681ee55e71f33","observation_id":"7fe2337c-4657-423b-b733-7b91b5f3a839","resolution":{"observed_at":"2026-08-12T17:43:59.024823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.011792Z","title":"Oﬀ-po licy conﬁdence sequences","venue":null,"work_id":"aabd0a66-4186-4155-87ea-4e5f2d425200","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.477767Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:9d125586357705e9ed1a5cf620ea7f70e53f43e35f4cc427cdc5fd7d7afd8b46","observation_id":"2bd7d3f3-db7f-4c00-af86-588d5af2e177","resolution":{"observed_at":"2026-08-12T17:43:59.015260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05308","last_updated":"2025-02-20T16:32:53Z","snapshot_observed_at":"2026-07-06T08:56:56.465174Z","submitted_at":"2020-02-13T02:04:17Z","title":"Efficient Adaptive Experimental Design for Average Treatment Effect Estimation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05308","snapshot_observed_at":"2026-08-12T17:43:58.481508Z","title":"Eﬃcient adaptive experimental design for average treatment eﬀect estimation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.481508Z"},"links":{"cited_paper":"/paper/2002.05308","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:fdfcf972cf25d37ad56e6a493eb1f41a15875e24891e3d70f83e8541739cc82e","observation_id":"ef8513de-cbe9-4a65-8952-3db835d22697","resolution":{"observed_at":"2026-08-12T17:43:58.481508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:59.001678Z","title":"Irregular identiﬁcation, support conditions, and inverse weight estima- tion","venue":null,"work_id":"3fc216ac-9703-44ae-8b18-773600ec70ca","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.484430Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:9df1410d7a1cb5e7de86c0f579d12081edb988117ff7838571414c966486b984","observation_id":"70e4033f-2abc-4256-af5e-2f3bbe37c276","resolution":{"observed_at":"2026-08-12T17:43:59.005109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.991678Z","title":"Asymptotically eﬃcient ada ptive allocation rules","venue":null,"work_id":"9ef6d6d4-dc1a-4ad1-8f13-829ba7dab8db","year":1985},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.487162Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:3e971bfb38a48930762e29ac7405eb7f7c60f7fb871d539fc9586bad66f31125","observation_id":"c9c49b9a-9ba4-470a-b4ba-53cfe7aa30da","resolution":{"observed_at":"2026-08-12T17:43:58.995176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.489678Z","title":"Bandit algorithms","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.489678Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:8235829ddf5727422e45282b6496ed391de7f42a4255341dc15c91a0f66dcd73","observation_id":"8340bea5-6a62-4d7d-9302-6f9027d95a2e","resolution":{"observed_at":"2026-08-12T17:43:58.489678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.976368Z","title":"Local metric learning for oﬀ-policy evaluation in contextua l bandits with continuous actions","venue":null,"work_id":"2773ae72-a979-43aa-9094-f33f6f44abf5","year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.492191Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:a575305fe1aa25048841414a6f7df1a0fee92fe6206aec0b9f39c9315b9be448","observation_id":"71145d63-232b-40ae-af3c-f59f7086d9c7","resolution":{"observed_at":"2026-08-12T17:43:58.979962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.967762Z","title":"Distribution-free assessment of population overlap in observational studies","venue":null,"work_id":"541942cb-12e4-4810-af90-f07657db8e1e","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.494876Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:41c75e3186424b070937f286df64f9ca82befd7d432649a2aac7e07873d156b0","observation_id":"59b946f9-4f6c-4513-956b-4e5b40cb731d","resolution":{"observed_at":"2026-08-12T17:43:58.970619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.958442Z","title":"Sharp high-probability sample complexities for policy evaluation with linear function approximation","venue":null,"work_id":"7a0359bd-968e-426a-989c-80c792812d35","year":2023},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.497374Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:72a79f15438b0451e2b3399c11cbc4cc40657ea596eb8216afd1400b9c906dde","observation_id":"74c1930e-a5a0-49b4-a907-d89f17998b77","resolution":{"observed_at":"2026-08-12T17:43:58.961990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.948613Z","title":"Toward minimaxoﬀ-policy value estimation","venue":null,"work_id":"436ffda5-ec79-4f66-a41f-96199defea2e","year":2015},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.500400Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:4d064bea5165385a529346193abe70f67bfbd66075f0c8942428d323dcb55ff2","observation_id":"514c7f5d-4fe5-41ad-b7f4-1a26385c3c6b","resolution":{"observed_at":"2026-08-12T17:43:58.952463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.939356Z","title":"Statistical analysis with missing data , volume 793","venue":null,"work_id":"fa5f3019-564e-44da-a99e-cb20ea19642b","year":2019},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.503586Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:2a4a98f3c36d18bc4ef8fce01dc753711bb4e1c801d8df35fc002c771e2db73b","observation_id":"702998d8-e69f-46f9-a818-9ed76ae8d96e","resolution":{"observed_at":"2026-08-12T17:43:58.942657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.929794Z","title":"Statistical infer ence for the mean outcome under a possibly non-unique optimal treatment strategy","venue":null,"work_id":"1693cc8b-e127-41b7-b00f-3b5a68db755d","year":2016},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.506578Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:85e0e364671e3276dbefd431da154bb9db5effae242fa38ba5b27f1bb0c75663","observation_id":"4f599360-83c2-46fe-a12f-0d273eef2325","resolution":{"observed_at":"2026-08-12T17:43:58.933079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.920399Z","title":"Min imax oﬀ-policy evaluation for multi-armed bandits","venue":null,"work_id":"a691970c-4d48-4711-a703-d3c1369db2ca","year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.509538Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:b6b5acdaeac21462d4cedc7f6c2eea02585cf34983439ef8d326764d9560dc21","observation_id":"880a205a-4902-443e-ad93-6d7f137db380","resolution":{"observed_at":"2026-08-12T17:43:58.923814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13075","last_updated":"2022-09-26T23:50:55Z","snapshot_observed_at":"2026-08-13T14:18:50.085165Z","submitted_at":"2022-09-26T23:50:55Z","title":"Off-policy estimation of linear functionals: Non-asymptotic theory for semi-parametric efficiency","version":1},"cited_work":{"arxiv_id":"2209.13075","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.13075","snapshot_observed_at":"2026-08-12T17:43:58.634819Z","title":"Off-policy estimation of linear functionals: Non-asymptotic theory for semi-parametric efficiency","venue":"math.ST","work_id":"89f2c561-fd7d-47d7-a77b-838dd61e8fd0","year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.512501Z"},"links":{"cited_paper":"/paper/2209.13075","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:3ce97f86082b5568daa81b57d9d8941c52f29aa7369c05c4e93097eb683856b0","observation_id":"bceb8c21-f1ac-4b72-a0dd-d67635c8d435","resolution":{"observed_at":"2026-08-12T17:43:58.640071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.911277Z","title":"Eﬃcient counter factual learning from bandit feedback","venue":null,"work_id":"9ac8f45c-5da3-4462-b1f2-842b47754304","year":2019},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.516147Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:73f5a3def47c9eed402291904ae8ccd8b1790662703507c900eeb1e57d224fb0","observation_id":"54415f53-83e2-4302-bbeb-06c16943141e","resolution":{"observed_at":"2026-08-12T17:43:58.914524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.901807Z","title":"Oﬄine policy evaluation in large action spaces via outcome-oriented action group ing","venue":null,"work_id":"0260f793-6c96-46ea-bb9b-7fc9fa0b31ed","year":2023},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.519430Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:33a63396c113a0ff24a8893d1cfb62f0f33a0f63e84d6f7133b2a0bc307f4014","observation_id":"c620aecc-93d6-472a-8f1d-1ebf3afd61b4","resolution":{"observed_at":"2026-08-12T17:43:58.905104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.893839Z","title":"Online non-parametric regression","venue":null,"work_id":"496c9dc1-d6c4-40f3-828e-6ea8652f6cbc","year":2014},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.522574Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:91bf01d7c35e2ce0355fbd7f1634971cad4d3c6bb88a1075b9842ca4c0230274","observation_id":"70e47d55-6214-43f6-80ad-4964406a5e51","resolution":{"observed_at":"2026-08-12T17:43:58.896509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.885630Z","title":"Seque ntial complexities and uniform mar- tingale laws of large numbers","venue":null,"work_id":"18c849f9-0c4d-428b-8a6d-f2529f3de622","year":2015},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.525570Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:cf3a96fc01c4cce46889db4ae11c09145f57d0f05133c886c8cdd3f2b25a1a36","observation_id":"6a50acc1-fa07-4676-9d78-ace03cdeeb35","resolution":{"observed_at":"2026-08-12T17:43:58.888627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.876713Z","title":"Relax and ra ndomize: From value to algorithms","venue":null,"work_id":"90b0af14-9ef5-4bad-938b-2805969da01c","year":2012},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.528627Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:0f0d24e44954746825c4c825c2254df41a7411373679d1cbf134a49ea4354a9e","observation_id":"0ad9acdd-50b3-4190-98a3-c0138b3c4caf","resolution":{"observed_at":"2026-08-12T17:43:58.879912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.866902Z","title":"Comment: Performance of double-robust estimators when” inverse probability” weights ar e highly variable","venue":null,"work_id":"65f6fcae-ef87-4e05-9726-d4ce452b17bf","year":2007},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.531540Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:2265d58d52979278652adf0e70b8a85189f8c60fbf2ca25eee9f3aada25d5b82","observation_id":"61554459-13d2-46f6-85d9-e83c8c8689db","resolution":{"observed_at":"2026-08-12T17:43:58.870744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.857009Z","title":"Semiparametric eﬃciency in multivariate regression models with missing data","venue":null,"work_id":"d19ca8bf-7de8-4d7c-b4ad-fc9080ff5033","year":1995},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.534555Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:1d7d4bc93d30e9bcaef72c898e3f5ffafa0922c33308dc604f50b1e81a3e89f4","observation_id":"17d2bccb-68fd-429f-bd91-b582d4ae5e5d","resolution":{"observed_at":"2026-08-12T17:43:58.860460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.847596Z","title":"Estimatio n of regression coeﬃcients when some regressors are not always observed","venue":null,"work_id":"39519790-2280-41ff-b58a-d52a6d6f0e73","year":1994},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.537719Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:3bb1dc4134551b883f18148cf65c9e679fdec54cc9e1a15a1a8fdbcb09e96312","observation_id":"2ef21956-0e7a-464d-b7e4-54e89463da98","resolution":{"observed_at":"2026-08-12T17:43:58.851091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.838004Z","title":"Analysis o f semiparametric regression models for repeated outcomes in the presence of missing data","venue":null,"work_id":"f85f0a4f-0919-4a21-b3c5-2d4a493b832c","year":1995},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.540801Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:22ae70178283ef5249e6df08b5f42f7e34606391f710078e9f8dfc0ada149e77","observation_id":"d4c43c02-d4e0-4815-9509-efa4d20b4331","resolution":{"observed_at":"2026-08-12T17:43:58.841575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.828457Z","title":"A tutorial on thompson sampling","venue":null,"work_id":"25e73551-cd49-4567-ab01-bb112254b170","year":2018},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.543919Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:a9f0e13c6b88656e388374586e0f536dbefcec6ac594df94e0ed17a4b8bfd6e1","observation_id":"df24683d-c045-4d2b-b50f-09943e68d932","resolution":{"observed_at":"2026-08-12T17:43:58.831606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06317","last_updated":"2022-06-16T00:15:19Z","snapshot_observed_at":"2026-08-13T16:42:14.673209Z","submitted_at":"2022-02-13T14:00:09Z","title":"Off-Policy Evaluation for Large Action Spaces via Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06317","snapshot_observed_at":"2026-08-12T17:43:58.546929Z","title":"Oﬀ-policy evaluation for larg e action spaces via embeddings","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.546929Z"},"links":{"cited_paper":"/paper/2202.06317","citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:ab2da2650b18814da4b334ede42c2551de4cb3ebf57ab85a2a4017795e7f5bb8","observation_id":"7dcc1f49-cef1-4b27-a663-9803d30b5ea5","resolution":{"observed_at":"2026-08-12T17:43:58.546929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.819348Z","title":"Oﬀ-policy ev aluation for large action spaces via conjunct eﬀect modeling","venue":null,"work_id":"0067cafe-1f03-4dc3-aeee-de8246d2aa40","year":2023},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.550231Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:9a3caf50528e123e88f11d3f828acbc4c8c1d2066d936c1f1ddf06cb17c82178","observation_id":"de50d675-da0e-4cb4-8ef2-25962971d72f","resolution":{"observed_at":"2026-08-12T17:43:58.822558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.811046Z","title":"Lear ning from logged implicit exploration data","venue":null,"work_id":"a8a37e35-74c9-4dfb-8d75-25edaa3ea8ce","year":2010},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.553443Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:455caa70e6e258c79a91c1b010424210a1cc0a351613b40bda6c1bb9bd2b3e63","observation_id":"2b63066d-06c7-41c8-b289-5469d9008d7f","resolution":{"observed_at":"2026-08-12T17:43:58.814022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.802973Z","title":"Doubly robust oﬀ-policy evaluation with shrinkage","venue":null,"work_id":"833c0527-08a3-491e-a86a-fd6ae14d33de","year":2020},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.556638Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:420f608caa0d4e39a28bbe5bad2bc43ff0d75e98cd44a5e93fb8a3a43e8477a2","observation_id":"b6bdbb72-811a-4e54-9836-42f2ed0d9109","resolution":{"observed_at":"2026-08-12T17:43:58.805656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.794823Z","title":"Cab: Continuous adaptive blend- ing for policy evaluation and learning","venue":null,"work_id":"b6326560-94d1-48af-9bf0-2d976a2bf994","year":null},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.559742Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:e2c234282ff5d67e2a70957f3788331856c1c03304532958439d3ab1e52e0608","observation_id":"8b319e47-8d66-4cf5-ad49-7037c7300635","resolution":{"observed_at":"2026-08-12T17:43:58.797671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.785812Z","title":"The self-normalized estimator for counterfactual learning","venue":null,"work_id":"cb058f45-9917-4294-a408-fec4c938af9e","year":2015},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.562987Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:f3e5ef227eb7155dd775e21133760b821fa5a9907ccda8394e94d66ba7aa9986","observation_id":"ecde691c-e9cc-4d95-b1c5-d1544122943d","resolution":{"observed_at":"2026-08-12T17:43:58.789061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.776893Z","title":"Data-eﬃcient oﬀ-policy policy eva luation for reinforcement learn- ing","venue":null,"work_id":"21a7e7f0-0be7-4ef4-b12f-84339a2c3e14","year":2016},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.566553Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:ff609220d67fadcee8e3af45cd68a1468b2fa8c18f5cd485e75b114460ebe543","observation_id":"e38b07e5-19f9-49d3-a04b-42ea05405a31","resolution":{"observed_at":"2026-08-12T17:43:58.780101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.767614Z","title":"On the likelihood that one unknown probability ex ceeds another in view of the evidence of two samples","venue":null,"work_id":"a1e06b7d-a608-4911-8e02-ded4a8eb3684","year":1933},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.569592Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:75f8dfd41dc29ef58e8523e9d4dd7b433bc3b11b869c28cad86908b0256813c3","observation_id":"c73b29ef-8313-497e-9d84-de6f5950c774","resolution":{"observed_at":"2026-08-12T17:43:58.771008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.758108Z","title":"The construction and analysis of adaptive group sequential designs","venue":null,"work_id":"bb202482-9ca8-43fa-bb36-a35bf8779cb3","year":2008},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.572740Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:e98a36c34fd42893352348340d137f0f734004d798b473481776eee2c51450e6","observation_id":"d4634878-2d7b-4c84-a5b6-a07f3bddd642","resolution":{"observed_at":"2026-08-12T17:43:58.761483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.748984Z","title":"High-dimensional statistics: A non-asymptotic viewpoint , volume 48","venue":null,"work_id":"e40fd2f1-4986-4e9f-9c77-e1816df073c1","year":2019},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.575839Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:53cb231e946e440a270fe10eb189f5ba282cbb82856f26307d16e3a0cb532d89","observation_id":"55ff0e85-6000-421d-8fef-6a9d3b9cd250","resolution":{"observed_at":"2026-08-12T17:43:58.752267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.739737Z","title":"Oracle-e ﬃcient pessimism: Oﬄine policy optimization in contextual bandits","venue":null,"work_id":"59dd5909-48fe-4e54-a144-ec162b16138c","year":2024},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.578928Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:1d07e74490db37495809e731513f846f0571788cd080c22f444796969a0b0d4f","observation_id":"0525e20e-def8-4f05-90d4-6c53dfd5e888","resolution":{"observed_at":"2026-08-12T17:43:58.743269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.730348Z","title":"Optimal and ad aptive oﬀ-policy evaluation in contextual bandits","venue":null,"work_id":"add7444b-1244-4c63-adb7-b9d212663d48","year":2017},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.581648Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:452afb25b520b0ae1535e3b21d4beaa8af5c38e648c5c0b8c1e3b7ad2dacc913","observation_id":"0ac61766-8332-43d3-b8f1-f7864532a8c4","resolution":{"observed_at":"2026-08-12T17:43:58.733433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.721301Z","title":"Anytime-valid oﬀ-policy inference for contextual bandits","venue":null,"work_id":"12a593d2-0270-468c-8fe2-2cf3e666a3f3","year":2024},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.584182Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:78c25c337d42d7bfa199c5f46fd47a027a1b4f7d5fb8801a41ff8f7b6bdfd6d5","observation_id":"649e6e36-317d-4fea-b7b2-eea3bb886478","resolution":{"observed_at":"2026-08-12T17:43:58.724253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.712444Z","title":"Asymptotic inference of causal eﬀects with o bservational studies trimmed by the estimated propensity scores","venue":null,"work_id":"6bb1450d-4bc5-46be-b568-1880329ea4d4","year":2018},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.586736Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:7f27710e846c8eeaac4a9efc1a4911689829d12fdd531a737861903713e51544","observation_id":"88d8437e-3d16-4f29-bd16-c7139087686d","resolution":{"observed_at":"2026-08-12T17:43:58.715417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.702791Z","title":"Oﬀ-policy evaluation via adaptive weighting with data from contextual bandits","venue":null,"work_id":"b011a9d3-4b42-4135-a108-f3c99614aed0","year":2021},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.589198Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:c7d03c622b9e7fb08405357e72b049e487a993b2de2a945a425caf23ed9405af","observation_id":"101db0d1-b20d-4d34-b628-83ec133cee91","resolution":{"observed_at":"2026-08-12T17:43:58.706252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.693002Z","title":"Policy learning with adaptively collected data","venue":null,"work_id":"323f6767-fd26-44a2-b497-c105fdc1ad1d","year":2023},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.591909Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:6189007e6cf247f8777fb0c09f8f1546a7c21eea4bd96b086544da48cb3cdb74","observation_id":"7a83b08d-89d3-434a-b576-448588353f15","resolution":{"observed_at":"2026-08-12T17:43:58.696569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:58.682544Z","title":"Inference for batched bandits","venue":null,"work_id":"9a563593-50f9-42e0-9f79-14e05e51fa96","year":2020},"citing_paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:58.594829Z"},"links":{"citing_paper":"/paper/2411.12786"},"observation_digest":"sha256:a8a7ec104852d7328266d8e278c158f458354e3d2a0fb200427ffdd1a56e4e61","observation_id":"755424cb-481b-4825-a410-50b2442d6e48","resolution":{"observed_at":"2026-08-12T17:43:58.686245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12786","last_updated":"2024-11-19T10:18:27Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-13T18:02:51.254768Z","submitted_at":"2024-11-19T10:18:27Z","title":"Off-policy estimation with adaptively collected data: the power of online learning"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":60},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2411.12786."}