{"as_of":"2026-08-17T03:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19dc611095ea3885a48a5e7a43c80a7ca1f404bd40cd92a1ce52bcc301665ae2","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:17:01.124208Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22492/citation-record","integrity":"/paper/2505.22492/integrity","json":"/paper/2505.22492/citation-record.json","paper":"/paper/2505.22492"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:52.903422Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:52.903422Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:cea6a63a578085f50e8dd97d1f1729759971a6705c172476c07b0817c105bf77","observation_id":"fe970c9f-0548-4569-aaa3-4eab2ff15df9","resolution":{"observed_at":"2026-08-07T13:16:52.903422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.021013Z","title":"and Kallus, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.021013Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:bb9314eff6d0fe646646ee4d1d87238ab17449bf878f9f1b67b46bccac4d2320","observation_id":"b62aa258-e78b-4938-bb97-799ce524f0ef","resolution":{"observed_at":"2026-08-07T13:16:53.021013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.103572Z","title":"Off-policy evaluation in doubly inhomogeneous environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.103572Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:202d12aab598f3d66585c2e493ad1bf5f75cada7abad687f4b0b1f3c9f26505a","observation_id":"3b741a11-b4dc-4569-b70d-945c5839b408","resolution":{"observed_at":"2026-08-07T13:16:53.103572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.186263Z","title":"More efficient off-policy evaluation through regularized targeted learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.186263Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:fd8ab1c067ef408c7b7617d4f994a3ebac7d33f967d4789298a94b276ddd8bcc","observation_id":"440371c0-981b-4670-bec6-f0aacf55fdae","resolution":{"observed_at":"2026-08-07T13:16:53.186263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.264406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.264406Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:312fb1c2d9df4707bb2ab834caf58e890acf96aa0358608d983185c62555ead7","observation_id":"342ab1ad-17f1-455a-9f63-4a19cc565efe","resolution":{"observed_at":"2026-08-07T13:16:53.264406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T13:16:53.388701Z","title":"Openai gym, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.388701Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:92e7c298b128b7129436bbf90aef0aeb08d043c9e3e6cda95a168d1d745d3ff9","observation_id":"552f657a-6eda-4337-a6d5-a218da5e2d98","resolution":{"observed_at":"2026-08-07T13:16:53.388701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2302.00662","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:04.645023Z","title":"and Zhou, A","venue":null,"work_id":"903c5ca2-f37d-4ebd-808f-c1fdee1684c5","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.496289Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:0a68c00fdd1c03219837261ac3c432873fea9f02192d61ad67548a10935d0beb","observation_id":"c6c5e743-b5b3-4cbb-aebf-ad81d8d95b29","resolution":{"observed_at":"2026-08-07T13:17:04.709883Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08697","last_updated":"2025-07-03T23:10:51Z","snapshot_observed_at":"2026-08-16T13:43:32.944208Z","submitted_at":"2024-06-12T23:41:43Z","title":"Structured Difference-of-Q via Orthogonal Learning","version":3},"cited_work":{"arxiv_id":"2406.08697","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08697","snapshot_observed_at":"2026-08-07T13:17:04.411213Z","title":"Structured Difference-of-Q via Orthogonal Learning","venue":"stat.ML","work_id":"bc5f8a07-d8fc-4308-a4cd-efe114748cf3","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.610687Z"},"links":{"cited_paper":"/paper/2406.08697","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:56cb26559d003ce27048d128dc8e4a9b28109f8c91b4ce4730ab5b25affdcc5f","observation_id":"8a06d0b8-b9d7-40c3-916f-86b10aa7c50a","resolution":{"observed_at":"2026-08-07T13:17:04.447238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.686598Z","title":"and Berger, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.686598Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:1fb88162295088c09266514e35c4e854f388e4969a2b4289157af4e5f4d84a48","observation_id":"67a52a5d-4608-4582-a6c2-bd0f88c6a259","resolution":{"observed_at":"2026-08-07T13:16:53.686598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.794136Z","title":"and Li, L","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.794136Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:4e43c792005732eecccac6691ddfd64b84988f402efadc9710cfcdd7fa4b7510","observation_id":"bc2ae633-0ad7-44ca-a0db-07a0658b0efa","resolution":{"observed_at":"2026-08-07T13:16:53.794136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:53.924369Z","title":"and Jiang, N","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:53.924369Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:11dfdc8bb352b509675035b0dbd5fc9f2f5d88f5873698c38b58b94371bdef08","observation_id":"49de3aaf-d1f8-4dbd-a4a4-759ad9b84b90","resolution":{"observed_at":"2026-08-07T13:16:53.924369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.023087Z","title":"and Qi, Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.023087Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:513e261b65a3d5bce6e94fe2fa5bf5e22ab6c0bde4e0a5e2071e06922424129f","observation_id":"b8a8b783-825e-4208-95fc-5d209ea87241","resolution":{"observed_at":"2026-08-07T13:16:54.023087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.133862Z","title":"Gaussian approximation of suprema of empirical processes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.133862Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:d0f319f4adb84a127be652102ab3262c3680d98f953bdccbb4fda61bca67cd58","observation_id":"fca476a0-cfa0-4d92-ab2b-9bf5fb2ca2f7","resolution":{"observed_at":"2026-08-07T13:16:54.133862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.246149Z","title":"Double/debiased machine learning for treatment and structural parameters","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.246149Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:24736ee5afdd117ed7652c5b0c60e8c8019ecf3358b0a6a465691b7161cf6f0e","observation_id":"52b4bb87-f570-4feb-84e1-1403a8ab136a","resolution":{"observed_at":"2026-08-07T13:16:54.246149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.339217Z","title":"Coindice: Off-policy confidence interval estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.339217Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:2aafcd089971fc27175fbd1eefd9462c20f7ea1f71062521fd3f8b35ef7d1c9f","observation_id":"db63a9a8-f309-47aa-acac-bd6bb2d1c379","resolution":{"observed_at":"2026-08-07T13:16:54.339217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.432077Z","title":"Doubly Robust Policy Evaluation and Optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.432077Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:07aa32c36ee1f7928b70ee3d728b5edef467cdd5c912f92127edf1891a759893","observation_id":"0a9c8274-3776-490b-a0ed-558411d6bf08","resolution":{"observed_at":"2026-08-07T13:16:54.432077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.524675Z","title":"A theoretical analysis of deep q-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.524675Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:cd940f19aed8365f8d5864537ffc5a9d02b7a43eefe7ede615415660d8352c35","observation_id":"8446019f-3832-4df8-9d51-6b1368b142b9","resolution":{"observed_at":"2026-08-07T13:16:54.524675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03493","last_updated":"2018-05-23T18:13:43Z","snapshot_observed_at":"2026-08-14T19:47:14.665247Z","submitted_at":"2018-02-10T01:32:03Z","title":"More Robust Doubly Robust Off-policy Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03493","snapshot_observed_at":"2026-08-07T13:16:54.617714Z","title":"More robust doubly robust off-policy evaluation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.617714Z"},"links":{"cited_paper":"/paper/1802.03493","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:137912d2fa2561032d786bc2a1382bedc3d27c032cf003e24e3c5e1c7c5522c6","observation_id":"25caa724-aca7-4a07-b9f0-dda5c47cd091","resolution":{"observed_at":"2026-08-07T13:16:54.617714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.732514Z","title":"Accountable off-policy evaluation with kernel B ellman statistics","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.732514Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:34f47342b5baaca38ca27a5fcfe2e3819c5a1380ffbe504c7fe520910b83a200","observation_id":"69d160b1-511b-4984-a4d4-ec8006edc122","resolution":{"observed_at":"2026-08-07T13:16:54.732514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:54.828722Z","title":"Combining parametric and nonparametric models for off-policy evaluation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.828722Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:88657d730d2ef9ae8ae417b56d4ff0b7a13c9ea2594ae49822076ced2be46c1d","observation_id":"1d2f3fc2-4499-45b8-ae5c-0061bd1e4779","resolution":{"observed_at":"2026-08-07T13:16:54.828722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:15.050550Z","title":"D., Thomas, P","venue":null,"work_id":"2c4d5e57-a0bf-4659-a57c-1d295f376a3a","year":2017},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.910774Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:b8493a421e4dc54b4356a691aa712dd680dca5ef06e5cc196220476cbacbd811","observation_id":"3e674bf6-aede-4609-a97b-8498caf0fb30","resolution":{"observed_at":"2026-08-07T13:17:15.124519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.915589Z","title":"Importance sampling policy evaluation with an estimated behavior policy","venue":null,"work_id":"719f7a58-2fa5-4da4-9e9f-672d10103f97","year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:54.995797Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:602360ee4110a1557824171fdf73616765c30c36faa1d3d4ab4c3c7bca41380b","observation_id":"238d6f10-29ef-4d5b-b3bf-b06331b78393","resolution":{"observed_at":"2026-08-07T13:17:14.980638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.749329Z","title":"P., Thomas, P","venue":null,"work_id":"72d9915f-df62-4c50-8e2f-561d29172e27","year":2017},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.071207Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:1c600af3ae556d87298babcca0ebe7c6c30df46f1f0ca5e90706ae4948ab560d","observation_id":"715be3ee-ce98-4c84-ac12-c5babdbdda54","resolution":{"observed_at":"2026-08-07T13:17:14.829766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.604182Z","title":"P., Niekum, S., and Stone, P","venue":null,"work_id":"d55aeb29-2251-4512-aa57-c93c11d50dac","year":2021},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.196586Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:e32860a09fadab01b3cf69103ac72378d0039df301dc44fc43c818bfcf559240","observation_id":"5db9c47a-84a6-4898-9dc1-e9c7a05cdcd1","resolution":{"observed_at":"2026-08-07T13:17:14.679690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.443424Z","title":"Bootstrapping fitted q-evaluation for off-policy inference","venue":null,"work_id":"443c7426-970c-416e-b0ab-b98a713a1be5","year":2021},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.317248Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:7465f1bc0de90536b79ab3e20501f202d5de5981d98f0173b59472cfb167d1b6","observation_id":"9c90fb45-6232-4e37-b518-1c03af849c8c","resolution":{"observed_at":"2026-08-07T13:17:14.525737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.319733Z","title":"Importance sampling via the estimated sampler","venue":null,"work_id":"04745017-68fc-4138-ac7a-27460a024bb1","year":2007},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.387170Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:96fb559b7b55778e509f926cde66c16485378998638788f2e26f217e529baf75","observation_id":"891b15a5-8bf1-45dc-abba-88a38f30a1b1","resolution":{"observed_at":"2026-08-07T13:17:14.384125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:14.099450Z","title":"W., and Ridder, G","venue":null,"work_id":"93e9a43e-5431-46f9-b9a7-df28e97edcaa","year":2003},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.459117Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:85bc1203f55829086ed39c3732c553dd8a7319a597f8138c8ec5b869d1a975e5","observation_id":"2ad6d719-9b29-446e-a5d2-f9e1a16fc9ca","resolution":{"observed_at":"2026-08-07T13:17:14.222790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:55.534857Z","title":"and Wager, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.534857Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:b8024c07b2a97c41214a72ba942ca4d59536630d0feffe41737f605c2d51f177","observation_id":"db7f3592-4268-4450-ba42-a0663dfe4af2","resolution":{"observed_at":"2026-08-07T13:16:55.534857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:13.947408Z","title":"and Li, L","venue":null,"work_id":"2c9fef03-de7f-41e7-aaf0-80afb3885778","year":2016},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.616369Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:d59d2b4d5f28a2621fb42ba8d23c06b7d05d4185e0cb54057b11ec5ab79728dd","observation_id":"ff3d687f-0b80-4dd4-a4d7-db5b0d93866d","resolution":{"observed_at":"2026-08-07T13:17:14.029859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:13.698454Z","title":"and Uehara, M","venue":null,"work_id":"d926e134-57cb-4bfb-861e-73bee86b03cb","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.716241Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:4c7afb30d934b5589970efaee270398e5a2c2eb65d0d765af67d331de0ab3db2","observation_id":"a42c0dd8-5648-4354-b424-84d1a4e77faa","resolution":{"observed_at":"2026-08-07T13:17:13.838362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:13.542001Z","title":"and Uehara, M","venue":null,"work_id":"e2876d6b-b544-461b-a38a-6e93ef5666d8","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.793014Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:378e14df68d8fd173777281f4e20c974e40891ca6e75fb93bb685304ef663cae","observation_id":"d404d600-7de2-4150-946b-5307bac95f8c","resolution":{"observed_at":"2026-08-07T13:17:13.626828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:13.307344Z","title":"and Zhou, A","venue":null,"work_id":"4d5f3d1c-c83c-4b97-bafa-1ef42137f520","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.872168Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:ae04d0ad01cf20f0d64fce106809c1b1e9c1c6a3c7b90f773239edebef430d65","observation_id":"6411d0f2-b200-46ad-b612-6dd15b17e52c","resolution":{"observed_at":"2026-08-07T13:17:13.420849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:13.048518Z","title":null,"venue":null,"work_id":"612d3274-d6c3-41cb-a076-699467d48443","year":2008},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:55.932696Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:24784f671ed12c158d32ee2c7cac8d05c809e0dc8fa1c6eb76bd5b79b6e2b20e","observation_id":"63221bff-3c62-45ab-9178-79969858e05b","resolution":{"observed_at":"2026-08-07T13:17:13.160576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.855828Z","title":"Batch policy learning under constraints","venue":null,"work_id":"bc37e5d9-508b-4f92-93c8-8a4507cd91ba","year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.017006Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:d1990fed05f2534b3e1b69ac688546e696fa78346520d640778ac403175ffb3b","observation_id":"5a9cc8b5-daf7-428d-9acd-b4d241a9daf0","resolution":{"observed_at":"2026-08-07T13:17:12.937701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T13:16:56.144780Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.144780Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:079a2affa0a1b9f6fd58b1f36e2d95c265cbf0f541a6b44a7d7d77e6392a573e","observation_id":"1924c1ed-bc7b-4f1b-98f6-816e702217d1","resolution":{"observed_at":"2026-08-07T13:16:56.144780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19001","last_updated":"2024-05-02T07:49:00Z","snapshot_observed_at":"2026-08-16T15:28:20.162442Z","submitted_at":"2023-05-30T12:58:39Z","title":"High-probability sample complexities for policy evaluation with linear function approximation","version":2},"cited_work":{"arxiv_id":"2305.19001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.19001","snapshot_observed_at":"2026-08-07T13:17:04.090075Z","title":"High-probability sample complexities for policy evaluation with linear function approximation","venue":"stat.ML","work_id":"3624e0ea-1bcb-441b-b5da-ebb8739c18c3","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.248494Z"},"links":{"cited_paper":"/paper/2305.19001","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:63074abbef8690658d7f609d1175fc65fd1bdfae614a9968f375befc258a6e6d","observation_id":"977884f7-69c5-4e80-aa98-3b38ff7c87f1","resolution":{"observed_at":"2026-08-07T13:17:04.262424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.704609Z","title":"Off-policy estimation of long-term average outcomes with applications to mobile health","venue":null,"work_id":"743ee5fa-8c6e-4ba7-99fe-45755cb27832","year":2021},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.359148Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:55029d98df79ca748c47cd8b086a4e1859900c9c2440604925bd917f82ab1e68","observation_id":"38ccf486-2bf4-47ce-91d8-e2cb5ef3fff3","resolution":{"observed_at":"2026-08-07T13:17:12.773972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.556256Z","title":null,"venue":null,"work_id":"878f76dd-af83-4f0c-92e3-3cbd6063f450","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.466433Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:5e607b646f899661e481ec5a857f1dc686e66f75fad87122e6f3df6fc2c1433e","observation_id":"67f38c91-6c96-4360-9f51-f15cbc3b435a","resolution":{"observed_at":"2026-08-07T13:17:12.624851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.396586Z","title":"Breaking the curse of horizon: infinite-horizon off-policy estimation","venue":null,"work_id":"6cd9d54c-13c7-48c4-83de-c2970d05353d","year":2018},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.565112Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:60d6adbe4049a8a58e7364f4bd06b745bb20b7e21630090cb443da2100535c7b","observation_id":"03b93b2d-2ad1-411f-9a43-8b252edd6bf6","resolution":{"observed_at":"2026-08-07T13:17:12.478362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.165788Z","title":"and Zhang, S","venue":null,"work_id":"d6f65545-820f-49d6-bf89-d7b7c327a4e2","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.671738Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:14b2f1a097d77354a103d1f7cced596e5a5c6a23816209f46c408f3d212a9b31","observation_id":"b1b84187-62f8-49de-bd51-6289711aa20c","resolution":{"observed_at":"2026-08-07T13:17:12.254767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02226","last_updated":"2025-03-20T05:00:23Z","snapshot_observed_at":"2026-08-16T13:13:05.067087Z","submitted_at":"2024-10-03T05:47:55Z","title":"Doubly Optimal Policy Evaluation for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02226","snapshot_observed_at":"2026-08-07T13:17:03.755725Z","title":"Doubly Optimal Policy Evaluation for Reinforcement Learning","venue":"cs.LG","work_id":"8b833e22-96d0-4b69-9736-04a3f042d22a","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.740396Z"},"links":{"cited_paper":"/paper/2410.02226","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:9a51c83269669bc32eaca2742043141b085462cba0e714aaf9eb98f8f5816590","observation_id":"20212785-c506-4558-a002-57494379b523","resolution":{"observed_at":"2026-08-07T13:17:03.912586Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02581","last_updated":"2025-03-01T12:55:13Z","snapshot_observed_at":"2026-08-16T14:55:15.357785Z","submitted_at":"2023-10-04T04:57:35Z","title":"Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.02581","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.02581","snapshot_observed_at":"2026-08-07T13:17:03.403559Z","title":"Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning","venue":"stat.ML","work_id":"a04a3c1f-d31d-41b6-8641-d6d4459db941","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.834090Z"},"links":{"cited_paper":"/paper/2310.02581","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:e62a93667a51fda9d7c33cab7429233b9713cb8e07b9416777a2609913a632cb","observation_id":"b6029ff5-5b9f-48b3-9947-4d1d444ba384","resolution":{"observed_at":"2026-08-07T13:17:03.551774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:56.946901Z","title":"J., Laber, E","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:56.946901Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:00f7a92558b5b36e9cf6b2a27a1742a68fce2cee18ee34d7d59c7a9fac2e45e2","observation_id":"1ed53d7c-3231-44c0-8f6b-0feeedbf69dc","resolution":{"observed_at":"2026-08-07T13:16:56.946901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:12.029448Z","title":"P., and Nowak, R","venue":null,"work_id":"b043f9bb-4744-495b-a942-5d1c53dfc7e2","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.007129Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:2c9f4cf9117aded379ea255ba338e9de976c07c23a0c252d1c158676abebc6a4","observation_id":"548001c1-8ac1-463d-adbe-e8cb79d621a4","resolution":{"observed_at":"2026-08-07T13:17:12.077014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:11.814006Z","title":"A., van der Laan, M","venue":null,"work_id":"c94fc38d-b488-438e-bf38-32da6becedeb","year":2001},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.074159Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:1196bfa2bc3a7540c39941408c0b11d50eb718ae9ce5ca1b94e9132b73e72306","observation_id":"e038af15-6e2e-40e6-8d48-d63427dd26d3","resolution":{"observed_at":"2026-08-07T13:17:11.923588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:11.619131Z","title":"Dualdice: Behavior-agnostic estimation of discounted stationary distribution corrections","venue":null,"work_id":"f2cbe6c2-0770-4969-a211-916afbe7415b","year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.135333Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:1671d5d7775892b06910cdb9ee0bf9fcee50f44286ec1f5712069189942b2d55","observation_id":"cb654943-6911-4027-b699-509c2785a743","resolution":{"observed_at":"2026-08-07T13:17:11.691191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10502","last_updated":"2021-09-22T03:36:51Z","snapshot_observed_at":"2026-08-16T17:54:58.428726Z","submitted_at":"2021-09-22T03:36:51Z","title":"A Spectral Approach to Off-Policy Evaluation for POMDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10502","snapshot_observed_at":"2026-08-07T13:16:57.195687Z","title":"and Jiang, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.195687Z"},"links":{"cited_paper":"/paper/2109.10502","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:8d9e963c2ca7f7c05fbf6e129c09e2373d7a45fde8b1fe8b1cc0a89b23b85f05","observation_id":"3bbf4a0c-7e88-437c-ba2e-7be99f60802d","resolution":{"observed_at":"2026-08-07T13:16:57.195687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:11.433970Z","title":"Off-policy policy evaluation for sequential decisions under unobserved confounding","venue":null,"work_id":"7cb34401-e07b-409b-b0cc-3a5ba29a2066","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.246652Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:19232d8a2de00e8f83bf33a63057e90863870e24a882c9771c272d5fc33f230e","observation_id":"877ba37c-7916-41a1-bbda-3021e7f63f2b","resolution":{"observed_at":"2026-08-07T13:17:11.540247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:11.220421Z","title":"K., Hsieh, F., and Robins, J","venue":null,"work_id":"fda25dfb-587a-4314-8578-e35a8c273113","year":1998},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.316362Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:29004bb5aef71e0ce87883d05efb76e1f33bacda71e83d9bd8bec382006cc745","observation_id":"fe049d9e-3dad-43a7-876b-39568be90b97","resolution":{"observed_at":"2026-08-07T13:17:11.289965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:57.362862Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.362862Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:a0912851fbed462f2c1c63d0c1d4d55e9368bfeb17372f258fac05fba864c2ba","observation_id":"220033ba-5dc0-445d-b8e8-855b2dd8aecf","resolution":{"observed_at":"2026-08-07T13:16:57.362862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:10.983751Z","title":"S., and Singh, S","venue":null,"work_id":"65a21c55-7d64-49ee-bd48-2708047bf222","year":2000},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.449604Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:f738537d430f6a215365249961a70a97b3fcff579f28d3bec7fac6a2f4b94931","observation_id":"7e730401-bf8b-41ff-a17e-a81d69418f46","resolution":{"observed_at":"2026-08-07T13:17:11.104301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:57.519872Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.519872Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:cfc8f46a60f91e15f14894dff3049b87ec38f363a3cce3e10f58e9527c3d22f7","observation_id":"c5644559-bd83-4111-bc92-4c2224a768b3","resolution":{"observed_at":"2026-08-07T13:16:57.519872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:10.748848Z","title":null,"venue":null,"work_id":"14d2a442-f0af-4f6c-bb3a-08436118f8b9","year":1983},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.582139Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:a949120080ff475fe5d9b974c05a465d63a19b3800b1140c947748418c71c652","observation_id":"eb28c104-9602-4e69-8561-9b0715d8a30c","resolution":{"observed_at":"2026-08-07T13:17:10.808173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:10.585906Z","title":"Conditional importance sampling for off-policy learning","venue":null,"work_id":"b32615fb-6f7e-4036-8c9f-754b3ac3f0d7","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.632221Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:cca610b92fc994410d1b09c6898379af7876f43c5640c0b09fca90af74113c28","observation_id":"4695e73b-5847-4e3f-82b9-e682b16dc01b","resolution":{"observed_at":"2026-08-07T13:17:10.692678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:10.338081Z","title":"G., and Dabney, W","venue":null,"work_id":"dc3fd4ed-ddc2-4891-8303-968a81b3efbf","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.718028Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:0dfd204df11273a2f82aaafe7e75d3dcac37a79f05f282190fecb12699315389","observation_id":"a5078da9-a7fa-4985-85d6-b91f6d93ef28","resolution":{"observed_at":"2026-08-07T13:17:10.457993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:16:57.801762Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.801762Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:cd0eae7c600c7bc6fce44b23b6e54bd1f82a8d89818d168ef19195b609e9613f","observation_id":"b9e6c4a0-196f-4998-8a2a-b23b71887564","resolution":{"observed_at":"2026-08-07T13:16:57.801762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:10.142396Z","title":"Estimating the dimension of a model","venue":null,"work_id":"64a2ef72-e697-4183-89c3-4919b86c5e2a","year":1978},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.866226Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:0f57b284e0639d051cc4b02fa2f15d3a8c70ef6fe45ca3a52af152e5e0877968","observation_id":"7e7a7233-70a3-4e87-b622-49670b846ed1","resolution":{"observed_at":"2026-08-07T13:17:10.220070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:57.934021Z","title":"and Ben-David, S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:57.934021Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:ae79e22cac75845591625d2f14ca66ee42be082130a0a00be98d0b3006dbadae","observation_id":"850e99cd-29f6-4007-a1c9-33882eea3cf1","resolution":{"observed_at":"2026-08-07T13:16:57.934021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:58.022585Z","title":"Mathematical Statistics","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.022585Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:ef83ba6dab02b65641ebc7674287cfdb18306509ade1e044ba8de604e5a4cdad","observation_id":"9afe5e2f-6267-448a-b52c-d34ce187313a","resolution":{"observed_at":"2026-08-07T13:16:58.022585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:09.934468Z","title":"On methods of sieves and penalization","venue":null,"work_id":"790ba65a-2950-4b34-9c6e-238ef1654f7f","year":1997},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.081016Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:783d1c9ffe94138b37fb09b65f180bb46b03c0fb195548bda6208097c63b832e","observation_id":"a5a578f7-f424-47bd-9594-7bb5521b9d41","resolution":{"observed_at":"2026-08-07T13:17:10.002895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:09.760641Z","title":"Deeply-debiased off-policy interval estimation","venue":null,"work_id":"1f2dab69-1a34-425a-8e6f-dfb1bf126ef1","year":2021},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.143606Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:0f8778b3ee4b7b3d4305001a51429935c84faff41652dab9628f4e4dc3095444","observation_id":"067892b6-6dcf-460f-93c9-2e9dfe291a08","resolution":{"observed_at":"2026-08-07T13:17:09.855972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:09.556829Z","title":"A minimax learning approach to off-policy evaluation in confounded partially observable markov decision processes","venue":null,"work_id":"e0244e02-6bc0-4252-96dc-bed3ca118bfb","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.211350Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:34349f517a5620d593a4f3c10c2f84f6f88539bd110531b06808bfd1d2415562","observation_id":"3587ffd9-3294-4bd0-b23e-85ae9726279a","resolution":{"observed_at":"2026-08-07T13:17:09.668572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:09.356091Z","title":"Statistical inference of the value function for reinforcement learning in infinite-horizon settings","venue":null,"work_id":"5c8d7d07-62e8-4a14-a5b7-0eb4a2739f6d","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.281999Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:79dd9fe924db98d8d047f44f45f665dbcd4533019b418b6c3d409f0942856825","observation_id":"337a06a4-da2c-4071-a7f1-ce0b1005ff5f","resolution":{"observed_at":"2026-08-07T13:17:09.489721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:09.113775Z","title":"Dynamic causal effects evaluation in a/b testing with a reinforcement learning framework","venue":null,"work_id":"6cc0b9a1-df1e-49e9-996e-e372dfc8880f","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.378112Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:dd9213060d347ebcb7a46dfe67c2e90ef2e3ea3f23e79d6ebcf39359081c8c5c","observation_id":"d688c1de-2597-498c-a6cf-596f4ba2351b","resolution":{"observed_at":"2026-08-07T13:17:09.222749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:08.917745Z","title":"Off-policy confidence interval estimation with confounded markov decision process","venue":null,"work_id":"12ffc5ee-aba0-4efa-ba05-d5f0196be863","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.470043Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:1946487b24140f73b0e4f64a3d9a1588d7a3ca8f9a105ec5f16c0e0b864c5b9a","observation_id":"d1a16f9e-e59f-46b5-a50d-514496496e92","resolution":{"observed_at":"2026-08-07T13:17:08.987934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05342","last_updated":"2025-01-11T06:39:01Z","snapshot_observed_at":"2026-08-16T13:27:21.757692Z","submitted_at":"2024-08-09T21:20:55Z","title":"ARMA-Design: Optimal Treatment Allocation Strategies for A/B Testing in Partially Observable Time Series Experiments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05342","snapshot_observed_at":"2026-08-07T13:16:58.476262Z","title":"Optimal treatment allocation strategies for a/b testing in partially observable time series experiments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.476262Z"},"links":{"cited_paper":"/paper/2408.05342","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:65bbb4b71ebe93c6c288d405e9966aa9a9095876e95d971a812b6f2c118308fe","observation_id":"61258582-d81d-4811-8a87-20401a18103d","resolution":{"observed_at":"2026-08-07T13:16:58.476262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:08.662685Z","title":"S., Szepesv \\'a ri, C., and Maei, H","venue":null,"work_id":"25de5c41-7488-4a09-b26d-1826e2f26f39","year":2008},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.553538Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:395801fdad507ffa5d608ee05569b3f1a8fa35a4866218ed27ec70cdb81a6e46","observation_id":"02bd134f-5140-496e-867d-2a6dc4b7aea0","resolution":{"observed_at":"2026-08-07T13:17:08.811401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:08.480046Z","title":"Doubly robust bias reduction in infinite horizon off-policy estimation","venue":null,"work_id":"a51edca6-9642-4dbe-8c80-ce23dd332cd1","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.648961Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:34818953dad599c52e43ca9148d5072ee8c886867d7de698f346bb3e37a82352","observation_id":"a266e348-4d60-4a95-a6c3-91f20e10358b","resolution":{"observed_at":"2026-08-07T13:17:08.583530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:08.188799Z","title":"Off-policy evaluation in partially observable environments","venue":null,"work_id":"af7e5557-f68f-4b64-87e3-dead7fe44416","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.740428Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:56654285aa25cd8d85ef782eadf375af43fa61eee7cf8f4cb3afc669551e69e4","observation_id":"bd7a0f40-a240-49ca-9b93-4c4ed5bba7b4","resolution":{"observed_at":"2026-08-07T13:17:08.354914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:08.017051Z","title":null,"venue":null,"work_id":"68b5d3dc-0654-4a7d-b72e-fd3b1e4b1c54","year":2016},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.839634Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:148ba64eb6ebc13624a9421c05b78c5582fe49cc8fa1e28611a2ebc769952218","observation_id":"6b8460eb-5193-457b-a1b5-abfd2a007cdb","resolution":{"observed_at":"2026-08-07T13:17:08.090302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:07.862572Z","title":"S., Theocharous, G., and Ghavamzadeh, M","venue":null,"work_id":"ff2704dc-2f97-4a65-815d-ad4803ab53a2","year":2015},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:58.954745Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:801e2f453bf95be6c794ff4abf6b2631b96526108924a29f687d87b444722c6d","observation_id":"01ac0eea-2e90-47dc-b9e5-108682734923","resolution":{"observed_at":"2026-08-07T13:17:07.914057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:07.681072Z","title":null,"venue":null,"work_id":"162450ea-bb24-4fb3-9410-eccce0efee7a","year":2006},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.070422Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:c838841842fb95fa677472d426718ec65feb57accea816a8268c2756bdd976b1","observation_id":"1319aa44-ad66-41b0-a89e-f24c72174927","resolution":{"observed_at":"2026-08-07T13:17:07.764164Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:07.507853Z","title":"Minimax weight and q-function learning for off-policy evaluation","venue":null,"work_id":"fd23d81b-7c21-48b2-a130-3f0b976a6e54","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.160195Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:531c6339b51a8152aebf7dcfadb0a08ff736fe511e410c74c983d5ad41095e6c","observation_id":"95427da5-953e-4828-a1a3-9afece42be71","resolution":{"observed_at":"2026-08-07T13:17:07.582206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-07T13:16:59.244313Z","title":"A review of off-policy evaluation in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.244313Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:17e4ddd41c94bbf7bcc30f95414201377a5fadd8b9d61b7956cab30aa4760448","observation_id":"545f29b9-a6c7-4efa-b8dc-a8ed35540f44","resolution":{"observed_at":"2026-08-07T13:16:59.244313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:07.321616Z","title":"Future-dependent value-based off-policy evaluation in pomdps","venue":null,"work_id":"9621d807-ca02-4448-8e8a-df8b5dc8b7e6","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.334783Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:efa254b00136656464ebeeb4ae621c6103234cb2d8f8f5bf2013f3ec340b133a","observation_id":"4faaad34-d831-47bf-9316-24161d54223a","resolution":{"observed_at":"2026-08-07T13:17:07.402734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:07.124501Z","title":"W., Wellner, J","venue":null,"work_id":"e3523efb-221b-446d-9a31-721820ccec54","year":1996},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.448099Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:8ad8f49a463ceccc1ced24361545acd5c9f4f917dcd08c2b223c83f410900b96","observation_id":"dbca4510-59cb-4e97-9bcb-3d4bd89e501e","resolution":{"observed_at":"2026-08-07T13:17:07.227633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.936038Z","title":"Safe exploration for efficient policy evaluation and comparison","venue":null,"work_id":"2220bea1-dc68-4717-8e57-8a1d7198481f","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.535998Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:320279f6024e2351ea72fc1344d551f0c16849f4cec11eaa955ea8c514ecde09","observation_id":"bce7b07e-cbc8-4d16-b354-076b5e4193d5","resolution":{"observed_at":"2026-08-07T13:17:07.029178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15448","last_updated":"2026-06-02T22:28:41Z","snapshot_observed_at":"2026-08-16T16:28:07.035413Z","submitted_at":"2022-09-29T16:03:07Z","title":"Blessing from Human-AI Interaction: Super Reinforcement Learning in Confounded Environments","version":3},"cited_work":{"arxiv_id":"2209.15448","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.15448","snapshot_observed_at":"2026-08-07T13:17:02.610605Z","title":"Blessing from Human-AI Interaction: Super Reinforcement Learning in Confounded Environments","venue":"cs.LG","work_id":"f52289fd-1207-44fa-8c8c-c0d52adc6b26","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.636730Z"},"links":{"cited_paper":"/paper/2209.15448","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:c02f6648ac0dfc79bd4cc8b95787832e19633f1ec5985da2070307429f3e0b22","observation_id":"a245a698-85c7-4393-ba08-1b02e7f94aea","resolution":{"observed_at":"2026-08-07T13:17:02.769580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.769854Z","title":null,"venue":null,"work_id":"88a52dce-7569-4230-a9b2-f9e1979d62b6","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.714007Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:7e317f9c075a574416b2b9f733b0f31cad4e58f230ffeb4ffff921cf4c49e159","observation_id":"323967c1-c2f2-4265-87d9-3bc98a27f1c8","resolution":{"observed_at":"2026-08-07T13:17:06.847343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.592794Z","title":"Off-policy evaluation for tabular reinforcement learning with synthetic trajectories","venue":null,"work_id":"0dd1f1ee-8146-4b27-8aca-9904ab21c65b","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.793756Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:5e9f918e58250248c4c18a2201662553b935d2e5fed734fd856c604c676a574b","observation_id":"e4fc61c2-0fef-43a3-9468-12ebcf38ec60","resolution":{"observed_at":"2026-08-07T13:17:06.682959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.419430Z","title":"Unraveling the interplay between carryover effects and reward autocorrelations in switchback experiments","venue":null,"work_id":"c25e4b94-57a2-4878-b72b-3b984fd3bc91","year":2025},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.899396Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:bdb8d0d1108be3eadaf593d38ae6f6d131632d9edc19d8fbf9725cc9dadfe129","observation_id":"563ceaa3-3eff-4226-94b7-4f6ddc600d0b","resolution":{"observed_at":"2026-08-07T13:17:06.487321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.224255Z","title":"Semiparametrically efficient off-policy evaluation in linear markov decision processes","venue":null,"work_id":"1b104e2d-2420-40eb-a0fb-5445bc77f5da","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.966690Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:c46293a4a8ac7c850d13f52498d6bade1309541b040ef74c9335864ba5e05a19","observation_id":"babb5910-858b-4ed3-8b50-cc5542ed781b","resolution":{"observed_at":"2026-08-07T13:17:06.298936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:06.040614Z","title":"Towards optimal off-policy evaluation for reinforcement learning with marginalized importance sampling","venue":null,"work_id":"4c3d85ba-af98-43c2-8c43-7959bce02bdd","year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.089605Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:0dada5f58567d3f00587e28c2c1c4f3d5c1365683221ddc1008ab0748f245df3","observation_id":"ffa3eb27-0ac8-42a5-a7a2-7949cdab0a73","resolution":{"observed_at":"2026-08-07T13:17:06.117651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.885085Z","title":"Towards optimal off-policy evaluation for reinforcement learning with marginalized importance sampling","venue":null,"work_id":"817182bc-fc9f-43cc-83c6-4decb1f6e70c","year":2019},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.188458Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:a97437c5ece7b02c2ad071c0480d68b2c21e6515844357303e179cd51600e3f9","observation_id":"748abfb2-46a1-4789-b90b-a28ee93d0e2f","resolution":{"observed_at":"2026-08-07T13:17:05.956955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14466","last_updated":"2022-12-29T22:01:43Z","snapshot_observed_at":"2026-08-16T16:05:22.556840Z","submitted_at":"2022-12-29T22:01:43Z","title":"Quantile Off-Policy Evaluation via Deep Conditional Generative Learning","version":1},"cited_work":{"arxiv_id":"2212.14466","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.14466","snapshot_observed_at":"2026-08-07T13:17:02.159050Z","title":"Quantile Off-Policy Evaluation via Deep Conditional Generative Learning","venue":"stat.ML","work_id":"7d6f94ae-9ee2-461c-954c-33f1a4dc8a3a","year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.283152Z"},"links":{"cited_paper":"/paper/2212.14466","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:fd37ed49b8806840391d67b197f5fab4861e5bd45e134a16de322968bff21655","observation_id":"70ddb5a8-7bf2-4b41-83e2-ba540f4ed7b1","resolution":{"observed_at":"2026-08-07T13:17:02.401023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:00.380335Z","title":"An instrumental variable approach to confounded off-policy evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.380335Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:9eab8742a9f64bfa303e6f6df9d6c698b028a50a7029fe4ad19c6a802d07c704","observation_id":"6de15f68-f83f-4b87-b49d-e48db67e2cf9","resolution":{"observed_at":"2026-08-07T13:17:00.380335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.727411Z","title":"and Wang, Y.-X","venue":null,"work_id":"e216efb8-aa39-4652-b72f-2ce05ee55aa7","year":2020},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.494044Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:bb30b4f33f0db7035467e2a9830b06dbeefb483f456d503c766faa3e0033bbba","observation_id":"84acc115-2bbd-4e54-8447-7ca1fb3ddd45","resolution":{"observed_at":"2026-08-07T13:17:05.792318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.584394Z","title":"Two-way deconfounder for off-policy evaluation in causal reinforcement learning","venue":null,"work_id":"1ab51eed-4a5f-4d62-8823-f244bd9929ac","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.581039Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:e517c7ccd336fe68eed51d60638005c865a3dc64476e9be9bafe53eaa220d2f0","observation_id":"e0498785-3fb3-4552-984a-f41cacf3261e","resolution":{"observed_at":"2026-08-07T13:17:05.635897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.435009Z","title":"A., Laber, E","venue":null,"work_id":"8ede70e2-9e4c-4515-a625-2509c87fb692","year":2012},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.642581Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:eefad28a5dc04e6f7c2017a1111b682149a7cb6baff89d031953fddfb0bc5b79","observation_id":"9856e75b-2403-45c1-9963-e03bb168f867","resolution":{"observed_at":"2026-08-07T13:17:05.492543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.292196Z","title":"A., Laber, E","venue":null,"work_id":"17991146-c45c-4a85-bd77-3b7e362adbb3","year":2013},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.743625Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:a5ff1d3c0181ecf6893e3dabd259dc631cf520e411076821d6d9805b7c0f6c2a","observation_id":"aff6e40f-7662-485f-bf4f-6aecd7d41bad","resolution":{"observed_at":"2026-08-07T13:17:05.360563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.159835Z","title":"and Zhang, Y","venue":null,"work_id":"bc26d8a8-05a4-47d2-bcb3-41169abf6f6b","year":2017},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.837982Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:537981e069733af9b7c79f34dcf0493b90af24bfb0ba807191aac8761b534556","observation_id":"091369b4-6ed4-49e7-9e1b-bbe140f8acdd","resolution":{"observed_at":"2026-08-07T13:17:05.217784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:05.003193Z","title":"B., and Kosorok, M","venue":null,"work_id":"5312e2f7-47f8-4de2-89e0-67c8bf78f4d7","year":2015},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.918164Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:8e73cf7ad61eb4a7f04101e3bf88e328a38d8a5f19d041b3648c1575157a3fd0","observation_id":"817f2570-b3f1-411c-8418-e5bb063fee49","resolution":{"observed_at":"2026-08-07T13:17:05.066644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13278","last_updated":"2023-10-02T00:41:01Z","snapshot_observed_at":"2026-08-16T14:58:16.706975Z","submitted_at":"2023-09-23T06:35:44Z","title":"Distributional Shift-Aware Off-Policy Interval Estimation: A Unified Error Quantification Framework","version":2},"cited_work":{"arxiv_id":"2309.13278","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.13278","snapshot_observed_at":"2026-08-07T13:17:01.406411Z","title":"Distributional Shift-Aware Off-Policy Interval Estimation: A Unified Error Quantification Framework","venue":"stat.ML","work_id":"741b4bc2-8f83-44df-bfa1-bad18820fd54","year":2023},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:00.981742Z"},"links":{"cited_paper":"/paper/2309.13278","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:066d0bc3fd5ef8a34e917d36d17b67ace8c90489f09dbcc3ffba21f210a537be","observation_id":"de491975-afd8-4969-9253-61c05ba1bdab","resolution":{"observed_at":"2026-08-07T13:17:01.728469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:04.835899Z","title":"Robust offline reinforcement learning with heavy-tailed rewards","venue":null,"work_id":"6892765e-6b14-4927-8066-f126df303a58","year":2024},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:01.051859Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:c4aa06e88229e921f87805bf0966f17b1aafbf6cdd8462ad41df255a3b40b700","observation_id":"8c1e2da9-074b-421d-9278-2c4e3909cf93","resolution":{"observed_at":"2026-08-07T13:17:04.924461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:01.124208Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T13:17:01.124208Z"},"links":{"citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:29bb3de571af2b5f3acf2dd4af794e5c0f3c52051af61d720b2d9d8ebdf11835","observation_id":"34152c82-94af-4f4e-a037-fa18debd6725","resolution":{"observed_at":"2026-08-07T13:17:01.124208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T10:29:19.996930Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":7,"verified_fuzzy":50},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 0 inbound Pith citation observations for arXiv:2505.22492."}