{"as_of":"2026-08-24T00:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:202d2fa01a238dd82a70594b3cf19b56c53169204894493aed74128fe8e942ce","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:17:38.664480Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":13,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-11T23:49:45.621188Z","title":"A review of off-policy evaluation in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02251","last_updated":"2025-02-19T18:48:18Z","snapshot_observed_at":"2026-08-16T10:57:16.766212Z","submitted_at":"2024-12-03T08:28:47Z","title":"Selective Reviews of Bandit Problems in AI via a Statistical View","version":3},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-11T23:49:45.621188Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2412.02251"},"observation_digest":"sha256:ab8585649ac59714b4283beee759cb9417e04ea33b63e21a572d389f809a617d","observation_id":"f38d36e8-384d-43cb-97c2-7292f3c6793c","resolution":{"observed_at":"2026-08-11T23:49:45.621188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-12T10:52:51.143142Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-16T21:31:34.034946Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.143142Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:2be202f17f64270387f880057525438a726427f805e382180a88dc69feb9417c","observation_id":"28cd3a95-016f-47d2-9b2e-0b0a0477d58e","resolution":{"observed_at":"2026-08-12T10:52:51.143142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-11T05:56:52.732140Z","title":"A r eview of oﬀ-policy evaluation in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17070","last_updated":"2026-06-29T06:38:58Z","snapshot_observed_at":"2026-08-15T11:33:26.886069Z","submitted_at":"2024-12-22T15:43:01Z","title":"Decoupled Functional Central Limit Theorems for Two-Time-Scale Stochastic Approximation","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T05:56:52.732140Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2412.17070"},"observation_digest":"sha256:a8f56df2da11304550d545ce19fa682b05a7ce1e76544ef4d5644474b90a049f","observation_id":"1a821d29-24b8-4596-b473-292c7a7b348c","resolution":{"observed_at":"2026-08-11T05:56:52.732140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-10T22:49:44.705573Z","title":"Markov Properties for Acyclic Directed Mixed Graphs","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.00854","last_updated":"2025-01-01T14:37:35Z","snapshot_observed_at":"2026-08-17T13:45:47.245706Z","submitted_at":"2025-01-01T14:37:35Z","title":"A Graphical Approach to State Variable Selection in Off-policy Learning","version":1},"reference_index":688,"source":"pdf_text","source_observed_at":"2026-08-10T22:49:44.705573Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2501.00854"},"observation_digest":"sha256:d3b6672049f68a2d8bd379c72d0aae884dbfbc35f4cfffc844ffa166280316ca","observation_id":"1ed861f4-25aa-4860-974f-4099b90c232b","resolution":{"observed_at":"2026-08-10T22:49:44.705573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-08T17:13:45.033105Z","title":"A review of off-policy evaluation in reinforcement learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06011","last_updated":"2025-02-09T20:05:19Z","snapshot_observed_at":"2026-08-09T08:42:52.458494Z","submitted_at":"2025-02-09T20:05:19Z","title":"Uncertainty Quantification and Causal Considerations for Off-Policy Decision Making","version":1},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-08-08T17:13:45.033105Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2502.06011"},"observation_digest":"sha256:4d54c2ff5bd3a71ac307b67eb557710ad4de08fac7b7fa4f9c4a84e53b9ee25e","observation_id":"dcc4a5bf-7afe-4a1a-8fbe-e4c2880169d5","resolution":{"observed_at":"2026-08-08T17:13:45.033105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-07T21:30:18.952146Z","title":"A review of off-policy evaluation in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09467","last_updated":"2025-07-16T12:48:21Z","snapshot_observed_at":"2026-08-20T10:12:48.068116Z","submitted_at":"2025-02-13T16:31:50Z","title":"Just Trial Once: Ongoing Causal Validation of Machine Learning Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T21:30:18.952146Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2502.09467"},"observation_digest":"sha256:88c207261415786d46b54a2783a65bc2f95e027a49b58b4e5e84e561c8970555","observation_id":"f6dff4d6-33d6-4d14-98ef-18243337a3db","resolution":{"observed_at":"2026-08-07T21:30:18.952146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2502.16156","last_updated":"2025-02-22T09:17:02Z","snapshot_observed_at":"2026-08-18T00:11:30.821724Z","submitted_at":"2025-02-22T09:17:02Z","title":"A Review of Causal Decision Making","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T02:47:21.582667Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2502.16156"},"observation_digest":"sha256:c4a8ede5cf241c66bf4a7e675693bdd0fccbdbdbbe6cfe989c9719c50b871fa9","observation_id":"fdbf2c37-bfe9-4204-9af2-6cf37b9050df","resolution":{"observed_at":"2026-05-23T02:47:26.298835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-16T12:17:38.664480Z","title":"A review of off-policy evaluation in rein- forcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-21T20:28:14.526068Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:38.664480Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2504.13368"},"observation_digest":"sha256:b4ccbb972b75ad573935c769145a98ec7fb0b36453356268561058dde2f33dd1","observation_id":"01ee2d5f-1c58-4ae7-bb69-e5c3ef572370","resolution":{"observed_at":"2026-08-16T12:17:38.664480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-16T05:16:16.592567Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21326","last_updated":"2025-04-30T05:26:51Z","snapshot_observed_at":"2026-08-17T03:41:16.982151Z","submitted_at":"2025-04-30T05:26:51Z","title":"Q-function Decomposition with Intervention Semantics with Factored Action Spaces","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T05:16:16.592567Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2504.21326"},"observation_digest":"sha256:89896585a69bda17492de8f8e4eaf1ce6cc8ef486cdddc526d2147bd12fa71c7","observation_id":"1b592663-8483-42d3-941e-c08e82b2e266","resolution":{"observed_at":"2026-08-16T05:16:16.592567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-15T20:14:55.385777Z","title":"Contextual Switch","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13809","last_updated":"2026-06-25T18:11:27Z","snapshot_observed_at":"2026-08-20T05:13:56.278571Z","submitted_at":"2025-05-20T01:41:44Z","title":"Semiparametric Off-Policy Inference for Optimal Policy Values under Possible Non-Uniqueness","version":5},"reference_index":9668,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:55.385777Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2505.13809"},"observation_digest":"sha256:d4dfc727a1df1fa43decfac812c80e5e830202bb022cc150d3b50b259c2ed919","observation_id":"6ebb3824-b34c-4ddb-a2ba-ceddff9ba563","resolution":{"observed_at":"2026-08-15T20:14:55.385777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-07T13:54:06.637025Z","title":"Uehara, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20781","last_updated":"2025-05-27T06:39:26Z","snapshot_observed_at":"2026-08-15T21:58:16.745692Z","submitted_at":"2025-05-27T06:39:26Z","title":"STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:06.637025Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2505.20781"},"observation_digest":"sha256:ee803e4e4e8584fa3d219033043bf56a102cbdca07b5888bf4ce5bdb3980ec46","observation_id":"623338d5-8695-4c94-bd4c-57012b7e388d","resolution":{"observed_at":"2026-08-07T13:54:06.637025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-07T13:16:59.244313Z","title":"A review of off-policy evaluation in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22492","last_updated":"2025-05-28T15:42:20Z","snapshot_observed_at":"2026-08-20T05:04:10.918036Z","submitted_at":"2025-05-28T15:42:20Z","title":"Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T13:16:59.244313Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2505.22492"},"observation_digest":"sha256:e177285a8b8774f9ccabea88d2fc9f8d7c8737e5f947a946c1ba43f9042d8440","observation_id":"545f29b9-a6c7-4efa-b8dc-a8ed35540f44","resolution":{"observed_at":"2026-08-07T13:16:59.244313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-07T10:30:36.368463Z","title":"arXiv preprint arXiv:2212.06355","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05308","last_updated":"2026-06-02T00:54:37Z","snapshot_observed_at":"2026-08-18T03:40:07.094313Z","submitted_at":"2025-06-05T17:53:26Z","title":"Estimation of Treatment Effects Under Nonstationarity via the Truncated Policy Gradient Estimator","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:30:36.368463Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2506.05308"},"observation_digest":"sha256:b041531a1194fae171e85e9de2a3605a043d3fd7ae11c79071c1160918933f1e","observation_id":"0975775b-e2e8-46ae-a211-5ebf3d29d9fe","resolution":{"observed_at":"2026-08-07T10:30:36.368463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-07T00:26:30.337409Z","title":"A review of off-policy evaluation in rein- forcement learning.arXiv preprint arXiv:2212.06355,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14439","last_updated":"2025-06-17T11:58:11Z","snapshot_observed_at":"2026-08-12T23:11:53.917733Z","submitted_at":"2025-06-17T11:58:11Z","title":"A General Framework for Off-Policy Learning with Partially-Observed Reward","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:30.337409Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2506.14439"},"observation_digest":"sha256:e8da295b671fa12bdbab6be13f0ebfc246facf28be3a81a3dd8129eea2c85c9f","observation_id":"ec131fbf-4ca2-419c-bc19-dbc1f811ceb2","resolution":{"observed_at":"2026-08-07T00:26:30.337409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-06T20:39:06.764758Z","title":"Uehara, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02211","last_updated":"2025-07-04T13:32:01Z","snapshot_observed_at":"2026-08-17T18:20:45.899150Z","submitted_at":"2025-07-03T00:17:53Z","title":"Dilution, Diffusion and Symbiosis in Spatial Prisoner's Dilemma with Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:06.764758Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2507.02211"},"observation_digest":"sha256:3a2f989e9ba708827d71234b2e125c89f5d4ff3c441cb983887cff6c724c52c7","observation_id":"5126c5e8-f0fc-41d3-8d70-f7a54f035b15","resolution":{"observed_at":"2026-08-06T20:39:06.764758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-06T16:28:52.147480Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13608","last_updated":"2025-07-18T02:23:37Z","snapshot_observed_at":"2026-08-12T22:19:05.078391Z","submitted_at":"2025-07-18T02:23:37Z","title":"Off-Policy Evaluation and Learning for Matching Markets","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.147480Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2507.13608"},"observation_digest":"sha256:4957f730eb4ed7185ee10fcc74f77095059e3777cdb0de8464eb740f3c35d838","observation_id":"71f77b42-b88d-45cb-9266-814c6c497742","resolution":{"observed_at":"2026-08-06T16:28:52.147480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-06T15:23:33.504561Z","title":"A review of off-policy evaluation in reinforcement learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16236","last_updated":"2025-07-22T05:12:29Z","snapshot_observed_at":"2026-08-16T17:32:02.183824Z","submitted_at":"2025-07-22T05:12:29Z","title":"PAC Off-Policy Prediction of Contextual Bandits","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:23:33.504561Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2507.16236"},"observation_digest":"sha256:2a0054f492d01adc6f78ab6e7be9a8d71d91af7838d12b6a7f373c1fe244cae7","observation_id":"3bf10217-2875-4625-a158-f035ca1bd6db","resolution":{"observed_at":"2026-08-06T15:23:33.504561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-06T14:47:25.679066Z","title":", Shi , Chengchun C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18118","last_updated":"2025-07-24T06:05:56Z","snapshot_observed_at":"2026-08-21T14:04:26.550643Z","submitted_at":"2025-07-24T06:05:56Z","title":"A Two-armed Bandit Framework for A/B Testing","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T14:47:25.679066Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2507.18118"},"observation_digest":"sha256:9889e4271a5dcea51453a6d8c8b9db0e9bcee2faf0b9694515c216443ccdee64","observation_id":"7a21733a-6d48-4443-b10c-18d2dea51e21","resolution":{"observed_at":"2026-08-06T14:47:25.679066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-04T00:30:42.106294Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.00802","last_updated":"2026-06-17T02:55:02Z","snapshot_observed_at":"2026-08-14T22:25:31.014942Z","submitted_at":"2025-11-02T04:47:17Z","title":"GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:42.106294Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2511.00802"},"observation_digest":"sha256:5ac48e26e99b0c75d35bcfba0a0ac27e5f21df41a9c0af94baadeff429f69407","observation_id":"fcb417b0-945c-4f23-a185-22671bba7419","resolution":{"observed_at":"2026-08-04T00:30:42.106294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-03T09:09:53.522461Z","title":"doi:10.1609/AAAI.V39I28.35143","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15353","last_updated":"2026-07-12T06:33:48Z","snapshot_observed_at":"2026-08-14T02:19:21.118748Z","submitted_at":"2026-01-21T04:58:49Z","title":"Reinforcement Learning in the Real World: A Survey of Statistical Challenges and Future Directions","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T09:09:53.522461Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2601.15353"},"observation_digest":"sha256:c366533c0103b4e3dff0bf5e5386b0a6213e006200368176ccf75aa5e6bba203","observation_id":"21904c4c-9910-44da-bd85-a2836baf8866","resolution":{"observed_at":"2026-08-03T09:09:53.522461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-07-13T22:27:27.987413Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.18700","last_updated":"2026-03-19T09:58:42Z","snapshot_observed_at":"2026-08-14T23:30:25.058784Z","submitted_at":"2026-03-19T09:58:42Z","title":"Hadronic screening masses in thermal QCD up to the electroweak scale","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T22:27:27.987413Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2603.18700"},"observation_digest":"sha256:1db28159376d583b69b62d834d90ebf6c3ca42d587c40ec729451454613ebd39","observation_id":"ca6dcb46-8b48-4b56-8d09-4d526e5c7b29","resolution":{"observed_at":"2026-07-13T22:27:27.987413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2603.18702","last_updated":"2026-05-17T14:46:48Z","snapshot_observed_at":"2026-07-06T22:49:42.664225Z","submitted_at":"2026-03-19T10:01:39Z","title":"Off-Policy Learning with Limited Supply","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T08:16:29.736803Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2603.18702"},"observation_digest":"sha256:07f1b774f06512402226b9b6b020ebd1298982990f0f5787c6194ac4cf3266f3","observation_id":"027dc780-29f4-45c1-a275-1c9f45d70988","resolution":{"observed_at":"2026-05-15T08:19:52.629413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2603.18702","last_updated":"2026-05-17T14:46:48Z","snapshot_observed_at":"2026-07-06T22:49:42.664225Z","submitted_at":"2026-03-19T10:01:39Z","title":"Off-Policy Learning with Limited Supply","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T11:17:13.734190Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2603.18702"},"observation_digest":"sha256:021bbdf9774dac22372202367318c2860b547cbf75d95ce8e8023f3139041c02","observation_id":"8022a691-20d7-4621-bc51-7288bba4170f","resolution":{"observed_at":"2026-05-21T11:20:02.388627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2604.18143","last_updated":"2026-04-24T06:58:50Z","snapshot_observed_at":"2026-08-14T15:02:39.379856Z","submitted_at":"2026-04-20T12:07:33Z","title":"Distributional Off-Policy Evaluation with Deep Quantile Process Regression","version":2},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-05-10T04:10:14.476158Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2604.18143"},"observation_digest":"sha256:447572c62e8f9042f95cbb7166363facb4cecdc507ca1cbec20395b29313dce5","observation_id":"9e757676-350e-496d-b3ca-cd690c2cf4c0","resolution":{"observed_at":"2026-05-11T12:06:03.889981Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2605.02112","last_updated":"2026-05-04T00:22:21Z","snapshot_observed_at":"2026-08-15T04:49:29.040595Z","submitted_at":"2026-05-04T00:22:21Z","title":"An adaptive variance estimator for relative sparsity","version":1},"reference_index":241,"source":"arxiv_source","source_observed_at":"2026-05-08T19:35:46.097113Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2605.02112"},"observation_digest":"sha256:e8b173c8ca6ac77fa5628c042845c3e5446c48970fdf7695301f3cc12eb70df5","observation_id":"a26eaaae-39f6-4f11-97c5-4b08e03d2779","resolution":{"observed_at":"2026-05-09T05:45:22.544207Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2605.15108","last_updated":"2026-05-15T16:30:03Z","snapshot_observed_at":"2026-08-15T16:00:25.857201Z","submitted_at":"2026-05-14T17:25:19Z","title":"Logging Policy Design for Off-Policy Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-15T03:08:07.248759Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2605.15108"},"observation_digest":"sha256:da764da104ca7ce3cafc85f67c35258973a4543bcfa1d4ccb98358b9215d7bcc","observation_id":"c449f5df-6fa4-4c3e-bef6-817e81e6fd42","resolution":{"observed_at":"2026-05-15T03:08:57.610094Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2605.15108","last_updated":"2026-05-15T16:30:03Z","snapshot_observed_at":"2026-08-15T16:00:25.857201Z","submitted_at":"2026-05-14T17:25:19Z","title":"Logging Policy Design for Off-Policy Evaluation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-20T20:40:06.337842Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2605.15108"},"observation_digest":"sha256:a27abdec5a936e8ea560ac0d4bf2beed4500ff2f52a55cf0604ca3b9478666a2","observation_id":"50ff0ba2-8551-46bf-a797-7fbf8e18210a","resolution":{"observed_at":"2026-05-20T20:43:43.471489Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2605.18509","last_updated":"2026-05-18T15:01:30Z","snapshot_observed_at":"2026-08-15T09:53:51.762167Z","submitted_at":"2026-05-18T15:01:30Z","title":"Offline Contextual Bandits in the Presence of New Actions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T12:01:35.633356Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2605.18509"},"observation_digest":"sha256:476d7ba26df26ca400a528a02f66a8c42ec222800e2c68093b2abda9bc8e52cc","observation_id":"624cbe2f-a7d7-404e-9bda-295f8c7a7e4c","resolution":{"observed_at":"2026-05-20T12:03:15.052928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2605.19208","last_updated":"2026-06-23T13:11:36Z","snapshot_observed_at":"2026-08-15T00:30:05.539936Z","submitted_at":"2026-05-19T00:17:59Z","title":"Precision Physical Activity Prescription via Reinforcement Learning for Functional Actions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T03:04:01.511997Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2605.19208"},"observation_digest":"sha256:bb5d8e665c4c2fdfcd86cee6047e44cc24e63b93d0788332d96aba434757febc","observation_id":"f40bba13-9c9b-4dfb-a913-204a65a5d85b","resolution":{"observed_at":"2026-05-20T03:08:02.149098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2605.19208","last_updated":"2026-06-23T13:11:36Z","snapshot_observed_at":"2026-08-15T00:30:05.539936Z","submitted_at":"2026-05-19T00:17:59Z","title":"Precision Physical Activity Prescription via Reinforcement Learning for Functional Actions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T18:16:37.532243Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2605.19208"},"observation_digest":"sha256:f4bd709b6ce5312c0b0897b08e27dc49b19f27d4307c32fdbfa2d5d1be2f6496","observation_id":"19a8af3d-0ca2-4ce8-919d-1d09008e38b1","resolution":{"observed_at":"2026-07-01T15:05:47.766604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2605.25114","last_updated":"2026-05-24T14:54:06Z","snapshot_observed_at":"2026-07-06T23:35:06.733347Z","submitted_at":"2026-05-24T14:54:06Z","title":"Counterfactually Safe Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T23:48:41.383288Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2605.25114"},"observation_digest":"sha256:63648fc374227391eda9cc656af53739646865f4edd363d2fd31019723443a72","observation_id":"c0aca948-a556-4307-a27e-022f73be3e7c","resolution":{"observed_at":"2026-06-30T00:04:06.866592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2606.00913","last_updated":"2026-05-30T22:27:31Z","snapshot_observed_at":"2026-08-16T06:01:58.333354Z","submitted_at":"2026-05-30T22:27:31Z","title":"Bandit Simulation for Average Reward Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T17:50:08.211646Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2606.00913"},"observation_digest":"sha256:010aa3c80ca2b24b59c08d124643b9593ad829349801ca6f607e80320bb44417","observation_id":"5867cd6f-775f-49c8-976a-29c92c3f5270","resolution":{"observed_at":"2026-06-28T17:52:27.352054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2606.07308","last_updated":"2026-06-05T14:24:50Z","snapshot_observed_at":"2026-08-21T03:06:05.603348Z","submitted_at":"2026-06-05T14:24:50Z","title":"Off-Policy Evaluation with Strategic Agents via Local Disclosure","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T22:02:00.194193Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2606.07308"},"observation_digest":"sha256:4097c58f2ea995f5998167bd848f34f57f539a1520a965a7d3844b751dc59994","observation_id":"be0f2cab-3df7-4ccd-bea7-2b89e66b6a8b","resolution":{"observed_at":"2026-07-02T17:27:15.409007Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2606.17515","last_updated":"2026-06-16T04:49:19Z","snapshot_observed_at":"2026-08-06T17:59:04.273068Z","submitted_at":"2026-06-16T04:49:19Z","title":"Anytime-valid Optimal Policy Identification","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T23:49:05.019752Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2606.17515"},"observation_digest":"sha256:e18b56d14b5723e20e67f1432cc62661053862b7a18ee8c7d1635138b5c10502","observation_id":"d9b28a7f-849b-4fd2-9ba8-121c30bbeba1","resolution":{"observed_at":"2026-06-26T23:50:15.173974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2606.20206","last_updated":"2026-06-18T13:19:43Z","snapshot_observed_at":"2026-08-06T08:02:19.305046Z","submitted_at":"2026-06-18T13:19:43Z","title":"Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-26T15:38:16.806415Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2606.20206"},"observation_digest":"sha256:ee9395f2338c8ff59241564744d4e1d8dbc9ff06b810c6354cea577d277e1b75","observation_id":"39e8d999-992d-4257-866e-1528db3ffa24","resolution":{"observed_at":"2026-07-04T05:39:40.721840Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2606.22510","last_updated":"2026-06-21T14:04:33Z","snapshot_observed_at":"2026-08-15T03:31:59.442293Z","submitted_at":"2026-06-21T14:04:33Z","title":"Fed-CausalDiff: Decoupled Synchronization for Federated Do-Simulation and Policy Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T10:40:07.441340Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2606.22510"},"observation_digest":"sha256:08848a4885a1cec230732d7034908f43eb856e365a80a130cda7dd082c3b6f67","observation_id":"b769942f-d1d5-4cdd-863a-18578ec8467c","resolution":{"observed_at":"2026-07-04T08:59:43.084562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2607.05375","last_updated":"2026-07-28T16:20:46Z","snapshot_observed_at":"2026-08-13T17:58:17.954177Z","submitted_at":"2026-07-06T17:53:32Z","title":"Fitted Occupancy-Ratio Evaluation without Bellman Completeness","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-07T14:25:33.921937Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2607.05375"},"observation_digest":"sha256:ef9f96419c7beccd8b6e6e1cdaee0e5b989b03b342782d63bb619067f41a77a9","observation_id":"d8fe23c9-8a2e-41a7-8ce8-dd776dc4186f","resolution":{"observed_at":"2026-07-07T14:33:54.263949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-02T08:33:36.437840Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05375","last_updated":"2026-07-28T16:20:46Z","snapshot_observed_at":"2026-08-13T17:58:17.954177Z","submitted_at":"2026-07-06T17:53:32Z","title":"Fitted Occupancy-Ratio Evaluation without Bellman Completeness","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T08:33:36.437840Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2607.05375"},"observation_digest":"sha256:22f2fc64977d6b2882ce6124c9e0945189becb6e748646d4cb52ef88a1694f6b","observation_id":"284b73ce-0129-48df-964e-0511d0912fb1","resolution":{"observed_at":"2026-08-02T08:33:36.437840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2212.06355","doi":"10.48550/arxiv.2212.06355","metadata_source":"pith","pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of causal estimation of effects in mediation analyses","venue":"stat.ML","work_id":"975a23f3-39fb-4195-bcf5-106f816db4c3","year":2022},"citing_paper":{"arxiv_id":"2607.05792","last_updated":"2026-07-07T03:43:04Z","snapshot_observed_at":"2026-08-21T22:36:58.862930Z","submitted_at":"2026-07-07T03:43:04Z","title":"Estimating Causal Effects from Data Generated by Stochastic Algorithms","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T00:15:30.364680Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2607.05792"},"observation_digest":"sha256:c747ba0d354cd3b07441fddaded4f30777316dbb68c2f2056ac8120c22054b25","observation_id":"6315ae6e-de2c-4731-97dc-b49e5b50e184","resolution":{"observed_at":"2026-07-09T00:15:47.443944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:06.415735+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-07-13T05:33:39.540475Z","title":"arXiv preprint arXiv:2212.06355 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08951","last_updated":"2026-07-09T21:21:19Z","snapshot_observed_at":"2026-08-14T14:34:34.169253Z","submitted_at":"2026-07-09T21:21:19Z","title":"A Statistical Test for the Benefits of Personalizing Interventions","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-13T05:33:39.540475Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2607.08951"},"observation_digest":"sha256:f37a0b76ca32aabebe7d52cb9b3e5ce0048ad699780d326d97a404aa35ab0cac","observation_id":"491ff237-264e-4e00-a65b-322be70aa7fa","resolution":{"observed_at":"2026-07-13T05:33:39.540475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-01T06:09:46.724676Z","title":"A review of off-policy evaluation in rein- forcement learning.arXiv preprint arXiv:2212.06355,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22012","last_updated":"2026-07-24T06:17:31Z","snapshot_observed_at":"2026-08-21T04:12:32.448540Z","submitted_at":"2026-07-24T06:17:31Z","title":"Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T06:09:46.724676Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2607.22012"},"observation_digest":"sha256:0f29dcdc752cafc89a402e6a225e1caf10cb27f4ba1fa55c9b8d24f4bd2dde45","observation_id":"f43878d4-3aa2-42f8-9c17-ec9da84d492d","resolution":{"observed_at":"2026-08-01T06:09:46.724676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-01T03:07:12.773917Z","title":"arXiv preprint arXiv:2212.06355 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25241","last_updated":"2026-07-28T03:32:31Z","snapshot_observed_at":"2026-08-06T15:07:39.028853Z","submitted_at":"2026-07-28T03:32:31Z","title":"Learning from the Unseen: Offline Reinforcement Learning with Hidden Actions","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T03:07:12.773917Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2607.25241"},"observation_digest":"sha256:5ac7d1ba6b84a7ccbb088833ebacf74aa319088b07b1b291c7e76d7ad7950d03","observation_id":"fa3aa8a5-109a-4a65-81eb-688dc7111db7","resolution":{"observed_at":"2026-08-01T03:07:12.773917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-15T14:39:15.568605Z","title":"arXiv preprint arXiv:2212.06355 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T19:41:39.037201Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.568605Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:e3f38e15443b477d31684d303061989298ec3e43e40f6015086c3b75200e9929","observation_id":"1ce8b195-a019-46e1-a093-05fdf0f79678","resolution":{"observed_at":"2026-08-15T14:39:15.568605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.06355/citation-record","integrity":"/paper/2212.06355/integrity","json":"/paper/2212.06355/citation-record.json","paper":"/paper/2212.06355"},"outbound":[],"paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-16T16:09:06.835048Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2212.06355."}