{"as_of":"2026-08-17T16:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13a81f891b1745c5ce7cdc4dd23439951592f2390ffed25e6b98448b6bf22f1c","coverage":[{"denominator":106,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:26:49.464366Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:36:27.422590Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2412.05783","doi":"10.48550/arxiv.2412.05783","metadata_source":"pith","pith_arxiv_id":"2412.05783","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","venue":"cs.LG","work_id":"59e3efe6-62c7-4102-9c90-e558557ca8e2","year":2024},"citing_paper":{"arxiv_id":"2607.21090","last_updated":"2026-07-23T09:20:38Z","snapshot_observed_at":"2026-08-16T18:26:43.190722Z","submitted_at":"2026-07-23T09:20:38Z","title":"Training Large Language Models for Self-Explanation Faithfulness","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-08-01T08:36:27.422590Z"},"links":{"cited_paper":"/paper/2412.05783","citing_paper":"/paper/2607.21090"},"observation_digest":"sha256:2e70cb523aceec946d53a9815ef1ea7086756c9380b0c3e9728d3b0a92d8c90c","observation_id":"76ef2f32-1274-4e25-b5f0-bf677d993731","resolution":{"observed_at":"2026-08-01T08:38:36.968420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.05783/citation-record","integrity":"/paper/2412.05783/integrity","json":"/paper/2412.05783/citation-record.json","paper":"/paper/2412.05783"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.013868Z","title":"Formulation and estimation of dynamic models using panel data","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.013868Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6c569f0fad719fe539577c15ce904e09cef710c4334283743c57a5aa96d26da9","observation_id":"5cf9ca6b-303e-49b7-860a-b97f038ec39c","resolution":{"observed_at":"2026-08-11T20:26:49.013868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.019604Z","title":"Doubly robust identification for causal panel data models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.019604Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:43e60379daa5c681399347cb123b5c101c195bf27c532d4683a11f641c8c8918","observation_id":"81eab347-b38c-4953-a397-f6fa7bbcb21d","resolution":{"observed_at":"2026-08-11T20:26:49.019604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.024472Z","title":"Design-based analysis in difference-in-differences settings with staggered adoption","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.024472Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:2bcf13a306d6e326b2cb62f14cbe17f6fa5dc007a8655a44661caafdd4bd17a6","observation_id":"d392ba94-52de-418b-9353-b0106c23bf1f","resolution":{"observed_at":"2026-08-11T20:26:49.024472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.029217Z","title":"Econometric analysis of panel data, volume 4","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.029217Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:8e915de337cf88b24165ee08c6b3db2d0d3f67800b555defda31a6bcd538fd2d","observation_id":"a13dec1d-9588-44aa-bf28-610180a1d069","resolution":{"observed_at":"2026-08-11T20:26:49.029217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.033801Z","title":"Genetic risk profiles for cancer susceptibility and therapy response","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.033801Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:7480fd73a9f173c43ec489317cfe563b4ce7d87daa2e7c86db409600325aab1e","observation_id":"856b2df3-9142-4198-a91c-0af226994e1d","resolution":{"observed_at":"2026-08-11T20:26:49.033801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.038799Z","title":"Proximal reinforcement learning: Efficient off-policy evaluation in partially observed markov decision processes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.038799Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:8fed7462340f78ba4dbeb6d63cb533e4bdcf40065d9dfb8b2e5255a1861f97ec","observation_id":"b4fc580b-0d56-486a-9196-350a637475a3","resolution":{"observed_at":"2026-08-11T20:26:49.038799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08719","last_updated":"2024-08-18T14:21:58Z","snapshot_observed_at":"2026-08-16T23:31:27.629379Z","submitted_at":"2023-06-14T19:48:30Z","title":"Off-policy Evaluation in Doubly Inhomogeneous Environments","version":4},"cited_work":{"arxiv_id":"2306.08719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.08719","snapshot_observed_at":"2026-08-11T20:26:50.163709Z","title":"Off-policy Evaluation in Doubly Inhomogeneous Environments","venue":"stat.ME","work_id":"8369ad55-e494-43ab-b5bd-869b2bec16cd","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.043818Z"},"links":{"cited_paper":"/paper/2306.08719","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:45a4a0164ab6d3b6049a8aa927199a6185558cec6f4ee14f4fe61b1663039c09","observation_id":"2d2851fd-f9da-422f-a698-a9b11f3f2593","resolution":{"observed_at":"2026-08-11T20:26:50.168208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.048680Z","title":"Time series deconfounder: Estimating treatment effects over time in the presence of hidden confounders","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.048680Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:d13c4c0286b3ef9579ae00dbee96a88d6479ce5dc595e30fa87b0e999eb196cb","observation_id":"e6aa3b11-ad83-48f3-aa5e-d6c55cdf5ca9","resolution":{"observed_at":"2026-08-11T20:26:49.048680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.052749Z","title":"Robust fitted-q-evaluation and iteration under sequentially exogenous unobserved confounders","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.052749Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:3e86cd960074c462614682df865a0477e3188311304ef58d1368f508cd10fd3c","observation_id":"f3703407-ced8-4883-8a64-918f469106e4","resolution":{"observed_at":"2026-08-11T20:26:49.052749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.057216Z","title":"Treatment effects in interactive fixed effects models with a small number of time periods","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.057216Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:883995f91619e3eb5ef7da68c8cd52da1b2792839d6a639a3a2c0d338c342279","observation_id":"2f731838-1fa3-45b9-bd8d-fc1dcab8f1d9","resolution":{"observed_at":"2026-08-11T20:26:49.057216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.061405Z","title":"Statistical inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.061405Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:279810ab8ef579b8077bd6c51cb1d17596975e6b0c04faeb0d6f1b0bb177eca6","observation_id":"64d47dda-039d-4779-9afd-7c65d9605d74","resolution":{"observed_at":"2026-08-11T20:26:49.061405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.065314Z","title":"Universal off-policy evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.065314Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:e06cb85773f3a2a48df38f7e66bd078a8c2654df14a5f567ff0a52c8aa8ce423","observation_id":"674bde1d-3223-409c-babe-49b6fe6a5f80","resolution":{"observed_at":"2026-08-11T20:26:49.065314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.069222Z","title":"Testing for the markov property in time series","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.069222Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6d2c731a991ce794088f4f065c15bb4bee959c4fcfea6cedec98d697d3a33502","observation_id":"ea0ba1f1-cf76-4fa8-ad75-515556cd94b5","resolution":{"observed_at":"2026-08-11T20:26:49.069222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00360","last_updated":"2019-05-01T16:19:28Z","snapshot_observed_at":"2026-08-14T16:38:43.656509Z","submitted_at":"2019-05-01T16:19:28Z","title":"Information-Theoretic Considerations in Batch Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1905.00360","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.00360","snapshot_observed_at":"2026-08-11T20:26:50.063789Z","title":"Information-Theoretic Considerations in Batch Reinforcement Learning","venue":"cs.LG","work_id":"b0b5b3b7-40a2-4fdc-a67d-e9185adfc446","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.073582Z"},"links":{"cited_paper":"/paper/1905.00360","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:b22d7c1640d4e36fc6de4398e7368dfa9dc642253119653e2f662b131340d441","observation_id":"61ddd041-b55b-4d1e-932d-44105215db94","resolution":{"observed_at":"2026-08-11T20:26:50.069475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.078519Z","title":"On well-posedness and minimax optimal rates of nonparametric q-function estimation in off-policy evaluation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.078519Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:4495ceb6566245272a4e6741973acdfdcc76b3e048989e34477334c3014d4651","observation_id":"61dbe7c9-4d78-4c87-b6a3-b8ea0c5428b2","resolution":{"observed_at":"2026-08-11T20:26:49.078519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.083127Z","title":"On instrumental variable regression for deep offline policy evaluation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.083127Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:cecd5c9986682a290f42087e99f656c3647e0f8cdf616767b3b9f78bde05242a","observation_id":"79a87a3e-8b07-4c7e-9a83-f545bcf34291","resolution":{"observed_at":"2026-08-11T20:26:49.083127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.087629Z","title":"Double/debiased machine learning for treatment and structural parameters","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.087629Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:bcf4de174a5318e6f519a027dda773b4aba65601e40e684e85eadc84101a558c","observation_id":"cca7315a-4c7e-47dc-9384-2d46fd4f03d5","resolution":{"observed_at":"2026-08-11T20:26:49.087629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.092271Z","title":"A crash course in good and bad controls","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.092271Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:40224d2f0d035cae2a1f3c4511b7316f8b58d0b53339677216005e76c0fb2f58","observation_id":"54065e70-f661-480c-b050-cb993b19469e","resolution":{"observed_at":"2026-08-11T20:26:49.092271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.096926Z","title":"Coindice: Off-policy confidence interval estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.096926Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ce4297d00ffd3cbc9ab96748c8c575fb753c6324e08e12e09e2564974b5b4b5b","observation_id":"b3647527-68eb-42b6-ad3c-2c247dc2fb07","resolution":{"observed_at":"2026-08-11T20:26:49.096926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.101485Z","title":"Comment: Reflections on the deconfounder, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.101485Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:214595ab43bad22ff15f0049f5e9d37719eb04280f416bd75950ce25bbc4e63d","observation_id":"ad05cb02-d180-4a4a-9508-f57b7f20b71e","resolution":{"observed_at":"2026-08-11T20:26:49.101485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.105859Z","title":"Two-way fixed effects estimators with heterogeneous treatment effects","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.105859Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:996e2ea9630849b6e2854aa72b42cdd83c20b88ad1a40bddb188d8ac5901ad59","observation_id":"68dde355-1d55-49a3-b452-15c5bef507d5","resolution":{"observed_at":"2026-08-11T20:26:49.105859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06891","last_updated":"2025-06-08T19:29:18Z","snapshot_observed_at":"2026-08-16T17:21:24.756739Z","submitted_at":"2022-02-14T17:24:27Z","title":"Counterfactual inference in sequential experiments","version":5},"cited_work":{"arxiv_id":"2202.06891","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.06891","snapshot_observed_at":"2026-08-11T20:26:50.044056Z","title":"Counterfactual inference in sequential experiments","venue":"stat.ML","work_id":"09984ddf-db0b-4555-a567-3067042bb8bf","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.110445Z"},"links":{"cited_paper":"/paper/2202.06891","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:997d436c56200ee2d205704dd4529912015cebae369127dcaa6d6514541a5ee5","observation_id":"9ea2261c-b5ee-4ba1-aa62-e36811700efe","resolution":{"observed_at":"2026-08-11T20:26:50.049057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.115428Z","title":"A theoretical analysis of deep q-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.115428Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6f58283b15debb60fc3fcd897f5037512a0d099a9d8963f359bf7f71ce33c8ee","observation_id":"722ea65d-52ee-42d8-9ce1-5a3902d93c9f","resolution":{"observed_at":"2026-08-11T20:26:49.115428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.119846Z","title":"More robust doubly robust off-policy evaluation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.119846Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ad59c66cea5e2516242190ab070ebded07be7ae828171180efd2cdc90b496183","observation_id":"6dc54f2f-3ac3-4e0a-ba59-30af9c519f98","resolution":{"observed_at":"2026-08-11T20:26:49.119846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.124324Z","title":"Deep neural networks for estimation and inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.124324Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:00e92da27fa99cf4e2396e4dc6ec1f265b1e3b5fb4b292add3b3ada01977eda8","observation_id":"1aa730a7-d898-46c9-9e90-bd224f8486c2","resolution":{"observed_at":"2026-08-11T20:26:49.124324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.128856Z","title":"Non-parametric panel data models with interactive fixed effects","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.128856Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:f651a4a25a3e83a89b7d6019a3eb3baddd7c9a948698e04fe11bc7ece674be78","observation_id":"d241ef39-edf2-4287-b0e8-deb304ea1fc6","resolution":{"observed_at":"2026-08-11T20:26:49.128856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08666","last_updated":"2022-09-18T22:03:55Z","snapshot_observed_at":"2026-08-16T16:31:40.208835Z","submitted_at":"2022-09-18T22:03:55Z","title":"Offline Reinforcement Learning with Instrumental Variables in Confounded Markov Decision Processes","version":1},"cited_work":{"arxiv_id":"2209.08666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.08666","snapshot_observed_at":"2026-08-11T20:26:50.023708Z","title":"Offline Reinforcement Learning with Instrumental Variables in Confounded Markov Decision Processes","venue":"cs.LG","work_id":"d8d42a2c-a108-4890-b54c-e9058efc1495","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.133163Z"},"links":{"cited_paper":"/paper/2209.08666","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:1b88584816f9fda0cd1d4255ba931ce99b233393e3b93ce959085da627c55a1c","observation_id":"4e1aa98c-71ab-44ca-8711-72bbcd9c208f","resolution":{"observed_at":"2026-08-11T20:26:50.028564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.138132Z","title":"Prediction of treatment response for combined chemo-and radiation therapy for non-small cell lung cancer patients using a bio-mathematical model","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.138132Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ec164de5f746f41a4b88c68fdbdcb459f23e8742dbe6b8603bf57c9637c55f39","observation_id":"71f7fafc-e76d-4c41-856e-74588a2a464e","resolution":{"observed_at":"2026-08-11T20:26:49.138132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.142440Z","title":"Issues in assessing the contribution of research and development to productivity growth","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.142440Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:bd529bb5c154312bd8c38a3686732cda71823f5c0e08884092e77f07bc095ab1","observation_id":"af85bcdc-9ff7-4a0b-bd0c-dc89ad0653d8","resolution":{"observed_at":"2026-08-11T20:26:49.142440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.147024Z","title":"Richard Guo, Anton Rask Lundborg, and Qingyuan Zhao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.147024Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:f7a9af280ec8b014ea5a0946a1ade698a17f62f7334ad6cc034c59ca20dc7dc6","observation_id":"4ca90b1d-0ee0-404d-a32e-8736af8529a9","resolution":{"observed_at":"2026-08-11T20:26:49.147024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-15T17:22:37.525122Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-11T20:26:49.151455Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.151455Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6c63b447eee626e3dce9d8defb241166c1641b53b56034fee224aa922fd1c742","observation_id":"52c89603-207b-4f0a-b66d-ed48e4f6765f","resolution":{"observed_at":"2026-08-11T20:26:49.151455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.156301Z","title":"Learning latent dynamics for planning from pixels","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.156301Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:83625e3d3461ef73054d814829daf709ceb19006181e95c0b2698b1cc23b8930","observation_id":"3bfd73e2-7b4c-4d1b-a9ba-66f424d966f0","resolution":{"observed_at":"2026-08-11T20:26:49.156301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.160798Z","title":"Bootstrapping fitted q-evaluation for off-policy inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.160798Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:06178be8fb17ea83d4fdb5fe6eb13b864454527daab2da5358f9a0fa876e72db","observation_id":"fa09841b-afa9-4af0-8f09-c107a472fb7d","resolution":{"observed_at":"2026-08-11T20:26:49.160798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09323","last_updated":"2022-02-28T07:39:59Z","snapshot_observed_at":"2026-08-16T18:31:08.213566Z","submitted_at":"2021-04-16T09:56:39Z","title":"Sequential Deconfounding for Causal Inference with Unobserved Confounders","version":3},"cited_work":{"arxiv_id":"2104.09323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.09323","snapshot_observed_at":"2026-08-11T20:26:49.988791Z","title":"Sequential Deconfounding for Causal Inference with Unobserved Confounders","venue":"stat.ME","work_id":"8dd3090b-50c6-4d0e-b51a-1f7c5ffc77cf","year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.165490Z"},"links":{"cited_paper":"/paper/2104.09323","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:7284034e85688400896c57c581681aa180084e5212c69947650482f570af1f31","observation_id":"52f1e374-03d7-4990-9a8d-02939d46e023","resolution":{"observed_at":"2026-08-11T20:26:49.994127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.170520Z","title":"Neural collaborative filtering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.170520Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:3f8bb2624d6bd75ba0d4c5d8c8dd8d0c952bd10663698ef6cf8d73b6db974299","observation_id":"7fe94afa-707d-4d74-8f53-c5f8b8746612","resolution":{"observed_at":"2026-08-11T20:26:49.170520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17083","last_updated":"2023-12-01T02:21:35Z","snapshot_observed_at":"2026-08-16T15:29:14.045944Z","submitted_at":"2023-05-26T16:48:05Z","title":"A Policy Gradient Method for Confounded POMDPs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17083","snapshot_observed_at":"2026-08-11T20:26:49.174755Z","title":"A policy gradient method for confounded pomdps","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.174755Z"},"links":{"cited_paper":"/paper/2305.17083","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:da961db02037dafe930a737fd8cdc0044c7ae6130c7cf6f8644126a3796fb845","observation_id":"1b616d7c-1356-4f6b-8bf4-a49d8e0f5007","resolution":{"observed_at":"2026-08-11T20:26:49.174755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.178967Z","title":"Collaborative filtering for implicit feedback datasets","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.178967Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:5f104acd6e1cec5b865933633de2668c308cae4b6924693b935b3bde4ad2239f","observation_id":"e4cadad5-e646-4614-a495-325ffc3a13c8","resolution":{"observed_at":"2026-08-11T20:26:49.178967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.182754Z","title":"On the use of two-way fixed effects regression models for causal inference with panel data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.182754Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:c2cea94b26616cb41b3a24e3bdfb16c7f636eb8fdc74b7aedc8b0e5729c5073d","observation_id":"f18883af-ed44-4dd2-9508-340088c4bad5","resolution":{"observed_at":"2026-08-11T20:26:49.182754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.794689Z","title":"Off-policy evaluation via off-policy classification","venue":null,"work_id":"084e563a-8c4a-4c6f-b004-8fcd47dbec70","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.186790Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:00650bfd69a7f242cdad6b8566e924a38b1fb7382d5f3d08856a4a7492c94083","observation_id":"32386744-8488-4fe7-9487-63338c368b07","resolution":{"observed_at":"2026-08-11T20:26:50.799584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.190846Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.190846Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:e9f5e25c8550e601edb6a04bba34d51e2198a7c595f646cb918641a59eb98204","observation_id":"a127d31e-b7f1-4795-8641-129d4520de1b","resolution":{"observed_at":"2026-08-11T20:26:49.190846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.194737Z","title":"A survey on knowledge graphs: Representation, acquisition, and applications","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.194737Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:3b403c9ade88525b74a82b0be3d9d95bf7af6795f4d10e40fbb872d8ff8dd7b8","observation_id":"71aaaba8-9046-4a8e-94b2-8f8cf63173aa","resolution":{"observed_at":"2026-08-11T20:26:49.194737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09946","last_updated":"2024-04-15T17:15:18Z","snapshot_observed_at":"2026-08-16T14:00:45.513822Z","submitted_at":"2024-04-15T17:15:18Z","title":"A Note on Loss Functions and Error Compounding in Model-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09946","snapshot_observed_at":"2026-08-11T20:26:49.199064Z","title":"A note on loss functions and error compounding in model-based reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.199064Z"},"links":{"cited_paper":"/paper/2404.09946","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:655995be506fae4f81646fa275a946614357cc7cb8f7a1690e839d75bd9976c0","observation_id":"0b532d18-1e37-4f82-a1f3-29eeea0c962c","resolution":{"observed_at":"2026-08-11T20:26:49.199064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.761827Z","title":"Doubly robust off-policy value evaluation for reinforcement learning","venue":null,"work_id":"b5999e80-b39b-420f-87fb-b4f5857da5d2","year":2016},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.203564Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:641d9715d18dcc7498de7fe25347ee59f07f2080f396b21aa1f77aa0c83ef202","observation_id":"a49847dc-e071-44ab-8e47-3da895f4dd04","resolution":{"observed_at":"2026-08-11T20:26:50.766712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.208020Z","title":"Mimic-iii, a freely accessible critical care database","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.208020Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:747f87b26cc47828620b2f49c3727d4d876d2bc77537b8bc331a900fb65cb891","observation_id":"af55c0cd-0b26-43a5-a67a-2265db6863e3","resolution":{"observed_at":"2026-08-11T20:26:49.208020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.212413Z","title":"Efficiently breaking the curse of horizon in off-policy evaluation with double reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.212413Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:5a672f6dec6335676f7bb1550f748bd9971a751b6f1005cd6ffb9fe4b6d084fa","observation_id":"64ee11ac-76dd-476a-87f0-6ae58685e7f9","resolution":{"observed_at":"2026-08-11T20:26:49.212413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.729243Z","title":"Confounding-robust policy evaluation in infinite-horizon reinforcement learning","venue":null,"work_id":"5d57313b-145c-4a31-a118-186f0b9c5283","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.216658Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:b5e32b28bad869b78eb6baed609ed8812f0214d79b49294cf2ac2532d9ec2f72","observation_id":"0e964bf1-c5cb-41ef-a054-15e682554714","resolution":{"observed_at":"2026-08-11T20:26:50.734020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16583","last_updated":"2023-11-07T04:52:04Z","snapshot_observed_at":"2026-08-16T16:12:16.920699Z","submitted_at":"2022-11-29T20:45:08Z","title":"Offline Policy Evaluation and Optimization under Confounding","version":4},"cited_work":{"arxiv_id":"2211.16583","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.16583","snapshot_observed_at":"2026-08-11T20:26:49.938381Z","title":"Offline Policy Evaluation and Optimization under Confounding","venue":"stat.ML","work_id":"be2026bc-f140-4e2d-b000-7463aeba6054","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.221467Z"},"links":{"cited_paper":"/paper/2211.16583","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:fce3a496b02ece85f1b508be79df81af5ca31da7b1d2897d9bc2ba309937a079","observation_id":"94a0e4f1-6eb6-483d-a136-302449c5190e","resolution":{"observed_at":"2026-08-11T20:26:49.943952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.714844Z","title":"Learning mixtures of markov chains and mdps","venue":null,"work_id":"fae4a2ed-c21d-4c04-aaa6-e92fb7538cf1","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.227412Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6ebc443b80a9b9bbdb11134706b618db6971ec053aba1f6f10c2d0125218ea19","observation_id":"3b6da3e7-58ef-4f93-be19-d93779cdf21d","resolution":{"observed_at":"2026-08-11T20:26:50.719425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.04021","last_updated":"2024-12-24T05:20:59Z","snapshot_observed_at":"2026-08-16T18:40:50.639473Z","submitted_at":"2021-03-06T03:57:46Z","title":"Asymptotic Theory for IV-Based Reinforcement Learning with Potential Endogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.04021","snapshot_observed_at":"2026-08-11T20:26:49.232155Z","title":"Causal reinforcement learning: An instrumental variable approach","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.232155Z"},"links":{"cited_paper":"/paper/2103.04021","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:d85cb029f20284651157c77772ffafc750158d13ae85bff7ff39049b9fc8e3d4","observation_id":"0e270572-5815-4174-bd97-59858a67f107","resolution":{"observed_at":"2026-08-11T20:26:49.232155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09907","last_updated":"2024-10-14T22:26:38Z","snapshot_observed_at":"2026-08-16T18:44:26.186722Z","submitted_at":"2021-02-19T13:01:40Z","title":"Instrumental Variable Value Iteration for Causal Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09907","snapshot_observed_at":"2026-08-11T20:26:49.237033Z","title":"Instrumental variable value iteration for causal offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.237033Z"},"links":{"cited_paper":"/paper/2102.09907","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:975ca1d09507b376ee445cd63a0d1c156055b76d5cdeb78c39d8622c403aba35","observation_id":"ff919683-2e4f-47ab-94b7-05a99ee2375c","resolution":{"observed_at":"2026-08-11T20:26:49.237033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.700946Z","title":"Off-policy estimation of long-term average outcomes with applications to mobile health","venue":null,"work_id":"1e2570c1-f2bd-4d21-9ee9-548b0123c476","year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.241606Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:fcd35d54b312a0527c5190c274a8e1a2739b93e99b3df3d35b914a5488e01174","observation_id":"d548c79c-5569-492f-bacf-4f08e31279a2","resolution":{"observed_at":"2026-08-11T20:26:50.705579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.685680Z","title":"Batch policy learning in average reward markov decision processes","venue":null,"work_id":"2f58ae94-9247-4446-93c5-c5b049841a14","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.245977Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:36c3b3e83ab0869da8b42f2895738d2e7430dc196aa535fc8030543d32135dfb","observation_id":"b53a4e2a-c74e-4d51-9b97-02e1eeb4febb","resolution":{"observed_at":"2026-08-11T20:26:50.690923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.250321Z","title":"Forecasting treatment responses over time using recurrent marginal structural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.250321Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:9bbd7e61a24e9aa3e318dab5cb74ce1aee8019636d44b189e2efed24d3db5ba8","observation_id":"4e5d4ad9-54f4-44a1-ac39-e5d5a85ef690","resolution":{"observed_at":"2026-08-11T20:26:49.250321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.254963Z","title":"Breaking the curse of horizon: Infinite-horizon off-policy estimation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.254963Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:7be643786ec5f07e2a598e5ec4cef8a4f100b8d23662560879042c1f5be150a3","observation_id":"65385c22-c2a2-4eff-b63e-d9162e098533","resolution":{"observed_at":"2026-08-11T20:26:49.254963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.653889Z","title":"Provably good batch off-policy reinforcement learning without great exploration","venue":null,"work_id":"fd92ce24-6a9e-435d-a3dd-1e59ff8f13fc","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.259473Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:462978cca2a71946ea371bd0aeff776102319b652025ff0ad6dbff288aef4196","observation_id":"0cc27e4d-b8ac-4b9f-bd0f-8969dd803f30","resolution":{"observed_at":"2026-08-11T20:26:50.658294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.264028Z","title":"Causal effect inference with deep latent-variable models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.264028Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:52accb5dc033f5e640ea02cf1241007164ffea934f101ce9139e193717c007af","observation_id":"6020fd7c-11f3-408c-8ef3-d621c217b820","resolution":{"observed_at":"2026-08-11T20:26:49.264028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.10576","last_updated":"2018-12-26T23:48:51Z","snapshot_observed_at":"2026-08-14T17:38:05.724596Z","submitted_at":"2018-12-26T23:48:51Z","title":"Deconfounding Reinforcement Learning in Observational Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.10576","snapshot_observed_at":"2026-08-11T20:26:49.268555Z","title":"Deconfounding reinforcement learning in observational settings","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.268555Z"},"links":{"cited_paper":"/paper/1812.10576","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:9fc2c4ec35009fb45ac5d3a97911a5158d8cfdc9275f573e2d70b3141e7ef84d","observation_id":"011c4092-9749-427a-9ef8-26338579198c","resolution":{"observed_at":"2026-08-11T20:26:49.268555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.631960Z","title":"Pessimism in the face of confounders: Provably efficient offline reinforcement learning in partially observable markov decision processes","venue":null,"work_id":"b1e64288-d342-45fd-8dd1-2a3a3a912dff","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.273622Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:41b340c04e885606c605249df96b79f52c5e151d52e63dcf83843dd1775c7d9f","observation_id":"fd481239-bf69-4c47-9a24-db357de512c5","resolution":{"observed_at":"2026-08-11T20:26:50.636096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.618947Z","title":"Estimating causal peer influence in homophilous social networks by inferring latent locations","venue":null,"work_id":"e4a89fd6-60e2-41e3-a082-e38e506b91e4","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.278278Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:f4e427fdc237d862fbf6b225cc9c7d41c34aa79e756649fbf44550b7866201ec","observation_id":"4a51b86d-dc62-426d-afdc-9fa3765d7c6b","resolution":{"observed_at":"2026-08-11T20:26:50.623463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.605391Z","title":"Off-policy evaluation for episodic partially observable markov decision processes under non-parametric models","venue":null,"work_id":"f5507be4-e3c8-4d02-a6c2-c8a822fac07b","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.282744Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:59a51c6aea1f208400c9520d21c0e821e8ee0f540baf57d22a5fc8b149f7087f","observation_id":"32153b46-476a-4467-aeae-7b83e851470e","resolution":{"observed_at":"2026-08-11T20:26:50.609868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.591360Z","title":"Empirical production function free of management bias","venue":null,"work_id":"fe99c963-6fdd-41c4-98e4-25d064368d72","year":1961},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.286681Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:83180bfaf581eb980ded95af2c511e4c2d7da69c31583c16879e67fd10cd73b0","observation_id":"fc41d0e5-9d07-4f21-8904-5012e55c1384","resolution":{"observed_at":"2026-08-11T20:26:50.595983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10502","last_updated":"2021-09-22T03:36:51Z","snapshot_observed_at":"2026-08-16T17:54:58.428726Z","submitted_at":"2021-09-22T03:36:51Z","title":"A Spectral Approach to Off-Policy Evaluation for POMDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10502","snapshot_observed_at":"2026-08-11T20:26:49.290906Z","title":"A spectral approach to off-policy evaluation for pomdps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.290906Z"},"links":{"cited_paper":"/paper/2109.10502","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:7e5fb4b8bbf091d901d9e7827575e063628c803c36ff5aef66a38424e190eb82","observation_id":"56e8f4d9-725a-4e58-8577-1a4e69e10266","resolution":{"observed_at":"2026-08-11T20:26:49.290906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.577354Z","title":"Off-policy policy evaluation for sequential decisions under unobserved confounding","venue":null,"work_id":"39d60e48-84c0-44dd-ab72-5c40ead0605c","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.295005Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:4737e5af2a4cbd2399373ee133f3d93524eb670250b4b26e144a8f425cf3b972","observation_id":"37f99efe-7629-4a6a-9394-86ee51e38913","resolution":{"observed_at":"2026-08-11T20:26:50.582136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.02121","last_updated":"2018-03-13T07:45:20Z","snapshot_observed_at":"2026-08-14T20:06:21.462280Z","submitted_at":"2017-12-06T10:41:47Z","title":"A Novel Embedding Model for Knowledge Base Completion Based on Convolutional Neural Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.02121","snapshot_observed_at":"2026-08-11T20:26:49.299285Z","title":"A novel embedding model for knowledge base completion based on convolutional neural network","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.299285Z"},"links":{"cited_paper":"/paper/1712.02121","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:fcc8b3b17b5221c1001c1e939fb595a36634c46120fe52ce47ed1b4f04f54c8a","observation_id":"54907508-141e-4877-a4e4-f4268c6c760a","resolution":{"observed_at":"2026-08-11T20:26:49.299285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.563124Z","title":"A review of relational machine learning for knowledge graphs","venue":null,"work_id":"556f1bc3-3b24-468b-aca9-716c5b6a3c51","year":2015},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.304112Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:cb81c262dfad09d14e1170a880aff071c8491921bff3a62eb25be98888a7883b","observation_id":"d57eeb98-a197-4cfd-92f9-518be18c6ab6","resolution":{"observed_at":"2026-08-11T20:26:50.567741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.548657Z","title":"Automated cars meet human drivers: responsible human-robot coordination and the ethics of mixed traffic","venue":null,"work_id":"efaa7d57-6736-4a85-9033-9412285e5ac0","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.308697Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ab074e330fadf2432fe456238b004fe0fd42022baa2282f37825654fc2ee65da","observation_id":"eca033d3-c3ed-4dac-b4a0-4093929bb8f9","resolution":{"observed_at":"2026-08-11T20:26:50.553282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.313162Z","title":"blessings of multiple causes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.313162Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:4ae31a9da6971b16dac7e77433183dc11da68903c0197280ea06ac717b157e26","observation_id":"0502d09e-fd3a-4c68-99bd-16bd2ce1a339","resolution":{"observed_at":"2026-08-11T20:26:49.313162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06555","last_updated":"2020-04-24T15:30:13Z","snapshot_observed_at":"2026-08-10T22:47:52.667987Z","submitted_at":"2020-01-17T23:33:32Z","title":"Counterexamples to \"The Blessings of Multiple Causes\" by Wang and Blei","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06555","snapshot_observed_at":"2026-08-11T20:26:49.317636Z","title":"the blessings of multiple causes","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.317636Z"},"links":{"cited_paper":"/paper/2001.06555","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:c151031538ae78f052dd2cc8a9979d0ff22889c080b45ae4fe9aabfa88ac9bb8","observation_id":"cd511ddc-54a8-4ae9-8bf4-841a0c66b884","resolution":{"observed_at":"2026-08-11T20:26:49.317636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.534802Z","title":"A critical look at the consistency of causal estimation with deep latent variable models","venue":null,"work_id":"0519ef85-dc6a-46ad-b5cc-a1cf7f8163ca","year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.322630Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:933d98323607324d491cb4076ba90135c534bd66291eac5387703812d6f8d535","observation_id":"f03a237d-00ca-423b-81c7-15fef16315ff","resolution":{"observed_at":"2026-08-11T20:26:50.539284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.521052Z","title":"Doubly robust difference-in-differences estimators","venue":null,"work_id":"1f2234cc-dc91-4941-997e-4fdd5db24edf","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.327210Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ae2436f32518c4787da6bf6c5eca1b4e4beb10640c8e34c203768897831b2e4e","observation_id":"0df06961-fb28-404c-9c24-a728d438e613","resolution":{"observed_at":"2026-08-11T20:26:50.525737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.506247Z","title":"Importance resampling for off-policy prediction","venue":null,"work_id":"284ddea3-a4bb-4607-b9a6-51ee9ec1013c","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.331634Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:4fadcc6e004b76f68d2bbbb0043ea12827d9f55f9498021b25592dad3dd5a077","observation_id":"a4e00b95-682b-4952-895e-f771f7975623","resolution":{"observed_at":"2026-08-11T20:26:50.511247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.336054Z","title":"Nonparametric regression using deep neural networks with relu activation function","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.336054Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:60dfdfefa2384dad63a784dc3081ca0c301a712025dd95e34e85d080bf1be311","observation_id":"76918f35-ec26-4eb2-a005-7527cb92a1ce","resolution":{"observed_at":"2026-08-11T20:26:49.336054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08209","last_updated":"2023-09-14T18:13:57Z","snapshot_observed_at":"2026-08-16T16:16:30.335003Z","submitted_at":"2022-11-14T04:14:37Z","title":"On counterfactual inference with unobserved confounding","version":3},"cited_work":{"arxiv_id":"2211.08209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.08209","snapshot_observed_at":"2026-08-11T20:26:49.768069Z","title":"On counterfactual inference with unobserved confounding","venue":"cs.LG","work_id":"1c1d96f7-0136-4c1b-ad8f-59f344194dd9","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.340724Z"},"links":{"cited_paper":"/paper/2211.08209","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:02f24155d8ada54a3d45c88747bfa88c02c04fb02b25af53e6a4b9092e6248fd","observation_id":"c94b25b5-0eb0-49ce-b030-b6d9692cd316","resolution":{"observed_at":"2026-08-11T20:26:49.773072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.491089Z","title":"Does the markov decision process fit the data: Testing for the markov property in sequential decision making","venue":null,"work_id":"e341edd5-8041-49a7-8e89-dd1ad7e1df88","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.345607Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:09e5e4d630859e6432f27f792bedb04955dd5e817b6641205c02c8c59fbda6d6","observation_id":"067ac510-944f-4d18-b6cb-84dc2de34cb7","resolution":{"observed_at":"2026-08-11T20:26:50.495984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.476308Z","title":"Deeply-debiased off-policy interval estimation","venue":null,"work_id":"2e63989f-b96a-42f3-965d-ead9615c4f8f","year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.350052Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:7a5a1a718ffcb642304d8805b41fc323e8e22d3b73be8a5651cb405326af20f5","observation_id":"dba602c9-a56e-4e02-af6c-fd7fbd4fcb16","resolution":{"observed_at":"2026-08-11T20:26:50.481440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.462245Z","title":"A minimax learning approach to off-policy evaluation in confounded partially observable markov decision processes","venue":null,"work_id":"0ecaef10-d599-448e-8016-988fb54ad676","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.354184Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6a6935165d29ad606cce2d71145ec017d454f4fd2e1a54e8bff7a002c295167d","observation_id":"01a0abe7-28ec-40c9-b6fa-76afeb142d23","resolution":{"observed_at":"2026-08-11T20:26:50.467036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.447200Z","title":"Statistical inference of the value function for reinforcement learning in infinite-horizon settings","venue":null,"work_id":"366e668c-7f0f-4c5e-90a2-245c6357e29c","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.358732Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:0008bb0650fcf9804bc44c03bed86f8665358fe1218b6e28b99cc6862ad5a092","observation_id":"9397cc0a-09a2-462f-8e3e-0ea8651c291e","resolution":{"observed_at":"2026-08-11T20:26:50.451972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.432610Z","title":"Off-policy confidence interval estimation with confounded markov decision process","venue":null,"work_id":"644cf926-1bf0-4c5f-856f-18bb40c64cc9","year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.363172Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:a3dc80cf8c89242cc1a4da077a35efc444cda9bbbd34e75c78e23d40867aab0a","observation_id":"f75aea1e-95db-497e-83dd-6c2ecff17798","resolution":{"observed_at":"2026-08-11T20:26:50.437357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2311.16793","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.740437Z","title":"Mediation pathway selection with unmeasured mediator-outcome confounding","venue":null,"work_id":"e62aeb78-64ec-41d4-aafd-44884bad6397","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.367414Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:814be43b8fab99910e6b4bad8f453b37d356278e82cad232a1b23a6f6eed12c3","observation_id":"611f730e-97af-4690-94ad-937ecc2f2c3f","resolution":{"observed_at":"2026-08-11T20:26:49.752062Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.371847Z","title":"Reasoning with neural tensor networks for knowledge base completion","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.371847Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ffe49e7dac999cff0a9adc45c4694a56c22ac609af439317060f11fc2993f88f","observation_id":"5a207d18-b0e6-48f3-9c1d-8d6dfc330435","resolution":{"observed_at":"2026-08-11T20:26:49.371847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.376356Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.376356Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:5148e57184df58b7ef30c87e17927c61f1302fd28f9eaee195b876201a9fc09e","observation_id":"8bf13f72-5146-4824-b96b-f6c32cf73b4b","resolution":{"observed_at":"2026-08-11T20:26:49.376356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07186","last_updated":"2019-10-16T06:33:17Z","snapshot_observed_at":"2026-08-13T07:32:12.415634Z","submitted_at":"2019-10-16T06:33:17Z","title":"Doubly Robust Bias Reduction in Infinite Horizon Off-Policy Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07186","snapshot_observed_at":"2026-08-11T20:26:49.381181Z","title":"Doubly robust bias reduction in infinite horizon off-policy estimation","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.381181Z"},"links":{"cited_paper":"/paper/1910.07186","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:456125cf30f933dba161630c8007cc866c8f084cf1fd876f5baccaa72f130ca3","observation_id":"e254b7c3-ddd9-4d3c-a61e-477b512f9f93","resolution":{"observed_at":"2026-08-11T20:26:49.381181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10982","last_updated":"2020-09-23T07:46:53Z","snapshot_observed_at":"2026-08-13T21:32:16.595182Z","submitted_at":"2020-09-23T07:46:53Z","title":"An Introduction to Proximal Causal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10982","snapshot_observed_at":"2026-08-11T20:26:49.385666Z","title":"An introduction to proximal causal learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.385666Z"},"links":{"cited_paper":"/paper/2009.10982","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:ecd65ecaceba9c9c7c26837d858b89b17e6f3c8fdc973cbbd03ab72bf588fbba","observation_id":"ff5acfdd-eea0-4bea-915a-509ac1b12643","resolution":{"observed_at":"2026-08-11T20:26:49.385666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.400565Z","title":"Off-policy evaluation in partially observable environments","venue":null,"work_id":"9748cc74-b854-45a7-bf04-3da2fda1b518","year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.390375Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:1eb518ad63ee9c362ba481646c11335052b757596aa3dd7710c85f4078e73bca","observation_id":"f53839b7-c0a4-4ed0-a2b4-dde6c539d20f","resolution":{"observed_at":"2026-08-11T20:26:50.405119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.386471Z","title":"Data-efficient off-policy policy evaluation for reinforcement learning","venue":null,"work_id":"db60124a-9dec-4530-aee6-3e2d909eeaab","year":2016},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.394915Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:6a15e078d1bcb13e90c00f5389b7b21a6ee9b1b15859b61875098ecad00197a0","observation_id":"2b35f4a5-8d54-4921-9d90-dacbeb46223a","resolution":{"observed_at":"2026-08-11T20:26:50.391180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.371527Z","title":"High-confidence off-policy evaluation","venue":null,"work_id":"c23d9293-5f7f-4225-9876-b5add4a2e8be","year":2015},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.399443Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:e11a1e2951362b3bc5a525cbac82e67c170757c47ee11bfd30454131b8e3ee65","observation_id":"3538c71c-a3a8-4ff6-975c-c9a846b1b822","resolution":{"observed_at":"2026-08-11T20:26:50.376590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10742","last_updated":"2017-10-30T02:05:10Z","snapshot_observed_at":"2026-08-14T20:19:08.462841Z","submitted_at":"2017-10-30T02:05:10Z","title":"Implicit Causal Models for Genome-wide Association Studies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10742","snapshot_observed_at":"2026-08-11T20:26:49.403988Z","title":"Implicit causal models for genome-wide association studies","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.403988Z"},"links":{"cited_paper":"/paper/1710.10742","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:135e2753537c9524ff726631a421803d4333617c532b80c5d6e003ca1293e6d6","observation_id":"aa3f4e79-c057-494b-94b1-6dd011a90948","resolution":{"observed_at":"2026-08-11T20:26:49.403988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06226","last_updated":"2023-01-10T04:15:46Z","snapshot_observed_at":"2026-08-16T18:10:18.637777Z","submitted_at":"2021-07-13T16:30:01Z","title":"Pessimistic Model-based Offline Reinforcement Learning under Partial Coverage","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06226","snapshot_observed_at":"2026-08-11T20:26:49.408990Z","title":"Pessimistic model-based offline RL: PAC bounds and posterior sampling under partial coverage","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.408990Z"},"links":{"cited_paper":"/paper/2107.06226","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:c163b663479a6a6aeb8a3100e4dc971e737abf1f12db9fe642a6fc02baeb85ec","observation_id":"8e91b53c-552f-45e5-ad6e-80d394d79687","resolution":{"observed_at":"2026-08-11T20:26:49.408990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.413790Z","title":"Minimax weight and q-function learning for off-policy evaluation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.413790Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:b5431ad97fb281acf5b7120cf5c9c5e58d4cb5a4b32ad0da5cbeeaecc290b329","observation_id":"b6b9adc8-d1cd-4b59-b49e-c42fafb9b975","resolution":{"observed_at":"2026-08-11T20:26:49.413790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.347576Z","title":"Using embeddings to correct for unobserved confounding in networks","venue":null,"work_id":"d03d9955-3038-42a0-97b2-2a5796d10d96","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.418982Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:e73a6ba1d1480a5a8e33d37118099d84329276c50411be24ff39fa208b8bbede","observation_id":"f501c8cd-c13f-4e91-ab43-6980c84cd4be","resolution":{"observed_at":"2026-08-11T20:26:50.352098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:49.423736Z","title":"Adapting text embeddings for causal inference","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.423736Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:c5fbe6cee2dfc38031a47e59f1538bef7af46de1a8fc5150d985a498858f5996","observation_id":"da6374d8-9829-4a5f-b237-bcc3689aef74","resolution":{"observed_at":"2026-08-11T20:26:49.423736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.324959Z","title":"Relational deep learning: A deep latent variable model for link prediction","venue":null,"work_id":"4a89564d-006a-4810-951a-009795615170","year":2017},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.428544Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:1aacb642005f2e09185d252e241f12857ba06abdbf320d53fc79e440cd047eaa","observation_id":"3b16c69a-bd9d-4fc2-a840-e839d600de9d","resolution":{"observed_at":"2026-08-11T20:26:50.329080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15448","last_updated":"2026-06-02T22:28:41Z","snapshot_observed_at":"2026-08-16T16:28:07.035413Z","submitted_at":"2022-09-29T16:03:07Z","title":"Blessing from Human-AI Interaction: Super Reinforcement Learning in Confounded Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15448","snapshot_observed_at":"2026-08-11T20:26:49.433207Z","title":"Blessing from experts: Super reinforcement learning in confounded environments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.433207Z"},"links":{"cited_paper":"/paper/2209.15448","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:7ac64196e2a9f5a47057c055388923f21fa09c3a2d079e47cbc1ffe1edf428cd","observation_id":"1f3480fa-a383-465c-8444-211ed4b6ea20","resolution":{"observed_at":"2026-08-11T20:26:49.433207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.311622Z","title":"Provably efficient causal reinforcement learning with confounded observational data","venue":null,"work_id":"d91f830c-4ca0-4118-a937-77b4a4982636","year":2021},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.438145Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:2ff68a0d514a0a23b17b654b59fe00201c25071a22f25b0f8106ea39a39ab45e","observation_id":"4b0b5083-cc16-4f7f-bcf0-a517aa9b41f3","resolution":{"observed_at":"2026-08-11T20:26:50.315863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.298118Z","title":"The blessings of multiple causes","venue":null,"work_id":"a1ded2c1-c0bd-4898-8792-79e45a4bf7f0","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.442778Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:49da3b043a6eb61084b808b7be51684774afd3a19df678be6bf8971989702de0","observation_id":"bdf0cca4-42c4-44f5-a381-04d74a0cc6f8","resolution":{"observed_at":"2026-08-11T20:26:50.302272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06581","last_updated":"2019-05-27T10:17:09Z","snapshot_observed_at":"2026-08-14T18:39:12.467714Z","submitted_at":"2018-08-20T17:41:39Z","title":"The Deconfounded Recommender: A Causal Inference Approach to Recommendation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06581","snapshot_observed_at":"2026-08-11T20:26:49.447182Z","title":"The deconfounded recommender: A causal inference approach to recommendation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.447182Z"},"links":{"cited_paper":"/paper/1808.06581","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:d8c192f5036b1653633cabc365722005f95bf9576a14fdbe3ba1cb2480eb3ca8","observation_id":"62992a5b-55ea-4fb3-a59e-7beabeab7809","resolution":{"observed_at":"2026-08-11T20:26:49.447182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.284007Z","title":"Semiparametrically efficient off-policy evaluation in linear markov decision processes","venue":null,"work_id":"ab6ebfb0-7c2b-4618-827b-a92803273999","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.451301Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:0bf9d395de67c00795354caa67b236d4e8e1044a68437ff7d699a7a4a1840140","observation_id":"358dc732-754a-4111-847a-086c856d366f","resolution":{"observed_at":"2026-08-11T20:26:50.288702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.269784Z","title":"Towards optimal off-policy evaluation for reinforcement learning with marginalized importance sampling","venue":null,"work_id":"03115336-6759-490e-b4c8-ef09be752aa4","year":2019},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.455826Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:55335cc6dc3af8feec5c2207013619ac8b14f5eeb1a072d97b5584bf4e6df583","observation_id":"3c3c5a1d-a062-4258-96ee-c74991263fb6","resolution":{"observed_at":"2026-08-11T20:26:50.274909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:26:50.255506Z","title":"An instrumental variable approach to confounded off-policy evaluation","venue":null,"work_id":"6b9afea2-a0c0-4897-b8f4-219ffbe76e82","year":2023},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.460191Z"},"links":{"citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:31720447b02fe856c292a2caad85e236c00fd5ec88fc5249c4af1f2fabe21d91","observation_id":"eb66cdb4-473c-43a7-a7f0-558b3da967f7","resolution":{"observed_at":"2026-08-11T20:26:50.260239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11040","last_updated":"2022-08-23T15:32:44Z","snapshot_observed_at":"2026-08-16T17:04:21.713910Z","submitted_at":"2022-08-23T15:32:44Z","title":"Strategic Decision-Making in the Presence of Information Asymmetry: Provably Efficient RL with Algorithmic Instruments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11040","snapshot_observed_at":"2026-08-11T20:26:49.464366Z","title":"Strategic decision-making in the presence of information asymmetry: Provably efficient rl with algorithmic instruments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-11T20:26:49.464366Z"},"links":{"cited_paper":"/paper/2208.11040","citing_paper":"/paper/2412.05783"},"observation_digest":"sha256:c9a078fc29564a48b14def6e309595bb81ea1d06253e71bd7e3a5941d5b8e137","observation_id":"7f363e52-78a9-4d07-b6c1-8d1bd082a64d","resolution":{"observed_at":"2026-08-11T20:26:49.464366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.05783","last_updated":"2024-12-08T02:28:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T23:31:06.738366Z","submitted_at":"2024-12-08T02:28:58Z","title":"Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":8,"verified_fuzzy":32},"total_outbound_references":106},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 106 outbound references and 1 inbound Pith citation observation for arXiv:2412.05783."}