{"as_of":"2026-08-17T16:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f63a714036d175e26fda78b1f72d0f50ca02b18e9da2f2b818783292b7f62b76","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:54:14.609941Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.00304/citation-record","integrity":"/paper/2505.00304/integrity","json":"/paper/2505.00304/citation-record.json","paper":"/paper/2505.00304"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.256109Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.256109Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:4d0352d6d061ff110e4033e3ea23856adbddb04e7dda614d4dcbe0e33d2d7d1a","observation_id":"cd4073d0-0038-4952-adf9-63822c6ee9da","resolution":{"observed_at":"2026-08-16T04:54:14.256109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.261809Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.261809Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:ff8d435a4e0d6fbae70b37a828e921b747eee2c0acf0ca2fc41b0fb48c964388","observation_id":"919d6f0d-5353-48de-8699-761051d85bab","resolution":{"observed_at":"2026-08-16T04:54:14.261809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.818577Z","title":null,"venue":null,"work_id":"90e514b8-73fe-4c0d-b23c-65f6fd7a587a","year":2012},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.266879Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:7649b2e477503a518c9b51faa8bc64d6556fffd8c7d2bbc1fcdf9fd3e92e185d","observation_id":"410f8da7-edd5-4ad3-9709-f6359a423471","resolution":{"observed_at":"2026-08-16T04:54:15.823487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.801103Z","title":"(2008), Learning near-optimal policies with Bellman-residual minimization based fitted policy iteration and a single sample path, Machine Learning, 71, 89--129","venue":null,"work_id":"e076ffac-27b6-41a1-a473-d33e522c5993","year":2008},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.271354Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:d90940f2d9b55ecd1996c12f5bd8fc017426862719833e6ded1e0ed11460b674","observation_id":"6fb5d4e1-7c06-417a-ad6f-51111b68b2b2","resolution":{"observed_at":"2026-08-16T04:54:15.806643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.786119Z","title":"(2017), Breaking the curse of dimensionality with convex neural networks, The Journal of Machine Learning Research, 18, 629--681","venue":null,"work_id":"433e3854-6815-4c24-a1ab-fee17769c825","year":2017},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.275782Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:cff76f4b20e1ff09253ba2e4b6de2466d172406071b63c44034e32b3e593a28f","observation_id":"4e3b1f35-75ae-4d39-bac0-44115f865f80","resolution":{"observed_at":"2026-08-16T04:54:15.790796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.770747Z","title":null,"venue":null,"work_id":"9855b773-1d91-4b94-9936-6aca29c4405d","year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.280602Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:b088271870492376031c5814c70c4ecc6d6a30d133a207d57a0289f146be26bb","observation_id":"7b1ecb43-2fc0-4ad4-afc2-de323f09bd6d","resolution":{"observed_at":"2026-08-16T04:54:15.775627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.755898Z","title":"and Kallus, N","venue":null,"work_id":"dc385da5-6d91-4645-952e-56d313441875","year":2023},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.285139Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:d88d0dd826a976593a386c147df6f1c41b3c3abe1f8a361c6939a338302ae597","observation_id":"f3845a6a-eff6-4af7-b773-d37f0917cade","resolution":{"observed_at":"2026-08-16T04:54:15.760428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.739857Z","title":"(2021), Off-policy evaluation in infinite-horizon reinforcement learning with latent confounders, in International Conference on Artificial Intelligence and Statistics, PMLR, pp","venue":null,"work_id":"29bad642-9c5d-4550-bb24-3356d79fcc10","year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.289645Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:87de5d9492e5f33efea94e8c441056e761253b39f0075fede6867129dbc28bed","observation_id":"2bfdfeb8-ce6d-418d-9481-3545b554ba51","resolution":{"observed_at":"2026-08-16T04:54:15.745039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.294412Z","title":"and Kennedy, E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.294412Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:4a4ae4f8ac5fb787f6db0f21094e98bdeb246d6dd9179f594a62f9bf1b3c2e3a","observation_id":"b13a54ca-1684-4dbe-9b79-434d67a8905e","resolution":{"observed_at":"2026-08-16T04:54:14.294412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.712961Z","title":"u derl, J., Schmiedeberg, C., Castiglioni, L., Arr \\'a nz Becker, O., Buhr, P., Fu , D., Ludwig, V., Schr \\","venue":null,"work_id":"d3fbdbc8-9aa0-44e4-b3f2-adb10e365cc0","year":2023},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.298932Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:088c8b8c788879187dcb95f4e19db2b49f231cddcb0899644f9ac1e665a11b10","observation_id":"466524b1-2ecf-4ea2-b1dd-f7190268ce50","resolution":{"observed_at":"2026-08-16T04:54:15.717702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.697202Z","title":"W., Yuan, Z., Zhou, S., Panerati, J., and Schoellig, A","venue":null,"work_id":"4fc9e0f6-72da-43e2-959a-ccd977e7edb7","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.303552Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:4edf35361368910a0ca94c227c8b78c6fd1177f08aec0cb31323f04c67b1b010","observation_id":"11852540-b5e5-49c5-b25f-bf5ea33bb747","resolution":{"observed_at":"2026-08-16T04:54:15.702282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.681179Z","title":null,"venue":null,"work_id":"8cdda3eb-22dd-4d79-8972-cee0cfd08d40","year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.308223Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:4ad7f172392f6b260817d92d73198f4fd14112f61ab6d760048a6d179fb4a119","observation_id":"ba310e6a-5471-49cb-849a-b1277b746cba","resolution":{"observed_at":"2026-08-16T04:54:15.686011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08885","last_updated":"2023-01-29T02:56:40Z","snapshot_observed_at":"2026-08-17T14:06:29.256880Z","submitted_at":"2021-11-17T03:29:59Z","title":"Jump Interval-Learning for Individualized Decision Making","version":2},"cited_work":{"arxiv_id":"2111.08885","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.08885","snapshot_observed_at":"2026-08-16T04:54:14.818872Z","title":"Jump Interval-Learning for Individualized Decision Making","venue":"stat.ME","work_id":"3e02e237-9ab4-4365-a396-de2fee7e0b08","year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.312790Z"},"links":{"cited_paper":"/paper/2111.08885","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:5a02f040068dee323de111dfc18b67ac9a3a19cca811b8f12893b0a46d4eac78","observation_id":"5ad80ee7-1129-4815-a00b-59980fb968fc","resolution":{"observed_at":"2026-08-16T04:54:14.824601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.665481Z","title":"(2022), Reinforcement learning from partial observation: Linear function approximation with provable sample efficiency, in International Conference on Machine Learning, PMLR, pp","venue":null,"work_id":"2c4e201f-9266-4241-9d90-1fd8ba26188f","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.317903Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:6aab994146c10a928371f1b4465180093cd2cc8ccc129e09bd13ed69d5344d34","observation_id":"818cf5dd-c8e1-4f46-a3c2-c31add3c0577","resolution":{"observed_at":"2026-08-16T04:54:15.670739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.649830Z","title":"and Qi, Z","venue":null,"work_id":"f6bb0fb4-062b-47eb-8624-453f684ce7e9","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.322320Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:a471603cda1f2a092b5be1de9b0588c70c3fff19442db47d0900c28226e69ce2","observation_id":"d2bf2f97-5c20-4453-ad01-9ca77c8cee3c","resolution":{"observed_at":"2026-08-16T04:54:15.654763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.634184Z","title":null,"venue":null,"work_id":"681226b3-84ab-43ae-97d3-246f5a3412a5","year":2017},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.326721Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:9579bcb9b00b77cb662d9545a05ba3750ad0ba314b98bf8d26d9805dc637aa68","observation_id":"b0d9fe11-a3c4-40b0-8ad2-6ba8367df1f9","resolution":{"observed_at":"2026-08-16T04:54:15.638815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.619022Z","title":"(2023), Semiparametric proximal causal inference, Journal of the American Statistical Association, 1--12","venue":null,"work_id":"cbb88985-907c-451b-b736-ed3f2a62f379","year":2023},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.331138Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:0a1311d0df541c3e675990a60af27ada4dbf982713f511218ee3395fa14cac5f","observation_id":"4e3b8511-e91b-4714-bcc7-1e34e89d429f","resolution":{"observed_at":"2026-08-16T04:54:15.623843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.335429Z","title":"and Tchetgen Tchetgen, E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.335429Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:2f8d3eb4882ac383a8496aaaa7c0a311670859a9b18c1c08207da1c103eceaeb","observation_id":"e9046a6a-e76e-46f2-93c4-d7e0f10f1179","resolution":{"observed_at":"2026-08-16T04:54:14.335429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.592860Z","title":"(2020), Minimax estimation of conditional moment models, Advances in Neural Information Processing Systems, 33, 12248--12262","venue":null,"work_id":"b629b51c-13bd-4cef-a5bc-74bd37f92291","year":2020},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.339985Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:5fbb6c881982501489425f858359730732d112689dcae12a8e7f8424fa57f3a0","observation_id":"29ef32ba-ce66-481e-a0ba-3e3a1705fd6d","resolution":{"observed_at":"2026-08-16T04:54:15.597816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.578149Z","title":"(2011), On the completeness condition in nonparametric instrumental problems, Econometric Theory, 27, 460--471","venue":null,"work_id":"4ac88912-21ad-414a-af57-99b9e147d4c8","year":2011},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.344496Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:cf917e0aced806631dcf47010abeed90a1149202e06d0c1d2ec9315e73993e10","observation_id":"9867b87c-580b-44ac-83f4-0b8b48f2b823","resolution":{"observed_at":"2026-08-16T04:54:15.583087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.562379Z","title":"(2016), Regularized policy iteration with nonparametric function spaces, Journal of Machine Learning Research, 17, 1--66","venue":null,"work_id":"2843941f-9cfb-4d32-af60-63d43482de08","year":2016},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.348905Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:c0d30a15e4e9a8eb2e42d2fd9ee6d17655ae0c70b11e4f77543762fa3b92d691","observation_id":"ec68a9cb-3a54-4b1e-87c4-b4a7ba7c94a1","resolution":{"observed_at":"2026-08-16T04:54:15.567752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.546573Z","title":"H., Moreau, Y., Murphy, S","venue":null,"work_id":"88fd29d4-a3fe-4e17-b6f8-6c7370e87e88","year":2018},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.353247Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:651aa847747a5decf53d3b200be1da726ce5a44e526961f0dc846921541157a8","observation_id":"d2ed938a-2311-4043-9762-36a090b59f61","resolution":{"observed_at":"2026-08-16T04:54:15.551560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08666","last_updated":"2022-09-18T22:03:55Z","snapshot_observed_at":"2026-08-16T16:31:40.208835Z","submitted_at":"2022-09-18T22:03:55Z","title":"Offline Reinforcement Learning with Instrumental Variables in Confounded Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.08666","snapshot_observed_at":"2026-08-16T04:54:14.357740Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.357740Z"},"links":{"cited_paper":"/paper/2209.08666","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:519ecf797e9517566b66e265534940d517ce37eda0f37b1468840e4a5815a82f","observation_id":"a4e09640-c797-485e-8822-c14d95c61cff","resolution":{"observed_at":"2026-08-16T04:54:14.357740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.531748Z","title":"and Gu, S","venue":null,"work_id":"f6ccb69b-826e-4d01-bee6-56323b1b84fb","year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.362574Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:5877f9afbf944b743bb2fdc1be165ff710cd2298e399fe2181173c9a6d9e139e","observation_id":"97ab3828-eec7-472b-bb43-0f08ce7f9dc4","resolution":{"observed_at":"2026-08-16T04:54:15.536508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.516535Z","title":null,"venue":null,"work_id":"952bd0bc-7c03-4c9a-903a-2b723df476b2","year":2009},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.367001Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:f26c83732adf827dc15a658f2a86ac9c53c1f0e5a007278d673f2f8a8f028007","observation_id":"22989646-d206-43d8-bf02-e108ba7e524b","resolution":{"observed_at":"2026-08-16T04:54:15.521397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.501989Z","title":null,"venue":null,"work_id":"bea676a5-488f-4b9a-b9f7-a95de17d6626","year":2000},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.371400Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:021a5b0d415869ab09de54ffac2874958f15b71cb9d6380bac3e7563b8bff46f","observation_id":"ef9c2fa8-2725-4236-b75d-1b1b5b19a955","resolution":{"observed_at":"2026-08-16T04:54:15.506348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.486234Z","title":"(2022), Provably efficient offline reinforcement learning for partially observable markov decision processes, in International Conference on Machine Learning, PMLR, pp","venue":null,"work_id":"9b085cff-bd52-4f36-b2b6-feaa0a4b1c99","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.375883Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:aab644c7f09031b91658a4c660b88464a99bef304e809c21a6b5d2b976e1071f","observation_id":"7a388575-444c-4319-a6c5-0497d81ae671","resolution":{"observed_at":"2026-08-16T04:54:15.491679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-16T04:54:14.380110Z","title":"(2018), Soft actor-critic algorithms and applications, arXiv preprint arXiv:1812.05905","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.380110Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:f5d8aac7949d75d4bc447168203edfb38ccab984d30329ccc9ab6f88aed39172","observation_id":"e918f253-246e-4e1c-9c86-be1d7007cfde","resolution":{"observed_at":"2026-08-16T04:54:14.380110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.471393Z","title":"(2021), Bootstrapping fitted q-evaluation for off-policy inference, in International Conference on Machine Learning, PMLR, pp","venue":null,"work_id":"9e2f45c3-4735-4613-9e0e-31c3c3bb0115","year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.384888Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:9412f97c40a4cd924610acf3d942c9d53dd435e87fd9eeddb63c3a9568438338","observation_id":"a0c36dbc-7f04-4b38-b8ec-feabeff990fe","resolution":{"observed_at":"2026-08-16T04:54:15.476082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.456537Z","title":"W., Lazaric, A., Ghavamzadeh, M., and Munos, R","venue":null,"work_id":"697b12ac-9a65-4732-b2c3-23c687ab8351","year":2011},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.390238Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:526ae80068eab862adb3a46991edbb010522c096c685a4403dcdb6ad1698b894","observation_id":"f542dcb4-c1a5-4151-b49c-b8e10f1fc051","resolution":{"observed_at":"2026-08-16T04:54:15.461072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17083","last_updated":"2023-12-01T02:21:35Z","snapshot_observed_at":"2026-08-16T15:29:14.045944Z","submitted_at":"2023-05-26T16:48:05Z","title":"A Policy Gradient Method for Confounded POMDPs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17083","snapshot_observed_at":"2026-08-16T04:54:14.394823Z","title":"(2023), A Policy Gradient Method for Confounded POMDPs, arXiv preprint arXiv:2305.17083","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.394823Z"},"links":{"cited_paper":"/paper/2305.17083","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:464bae133afeb11982c63474063d954f311311dca55b6e31faa453056b178f16","observation_id":"2c93aa95-6b44-413d-b947-93e017b98bb9","resolution":{"observed_at":"2026-08-16T04:54:14.394823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.441162Z","title":"(2020), Sample-efficient reinforcement learning of undercomplete pomdps, Advances in Neural Information Processing Systems, 33, 18530--18539","venue":null,"work_id":"3b46dca0-4a45-49d8-957d-6288eef814d8","year":2020},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.399509Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:6f2a2b171a24d8470ae9903437f6ed916948f6cf9f5cd7742b19b13ac5461269","observation_id":"4c83a170-793b-4e33-9c36-92dee9e03d32","resolution":{"observed_at":"2026-08-16T04:54:15.445717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.426172Z","title":"(2022), Doubly robust distributionally robust off-policy evaluation and learning, in International Conference on Machine Learning, PMLR, pp","venue":null,"work_id":"71650856-181d-40c9-b565-421b92fdd988","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.403922Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:476c6dcdedb19abe553801af6ae2ae93aebe76a085aef54f4d89d0452a28b720","observation_id":"679dbfa6-731c-40af-aaa2-0efcd270d2e8","resolution":{"observed_at":"2026-08-16T04:54:15.431262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.412084Z","title":"and Uehara, M","venue":null,"work_id":"21ead7ad-50e0-4358-bd8f-01a4f7dfb2e0","year":2020},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.408243Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:a4758c1d16798dd84f9e5b27f1177363bc1b19572e319b47ed2a03400a2f7f1a","observation_id":"41912fe6-7a55-40dc-bba5-46b1dde2d57c","resolution":{"observed_at":"2026-08-16T04:54:15.416571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.396342Z","title":"and Zhou, A","venue":null,"work_id":"c4024a3d-d71c-4b3d-a384-cc5927edbf66","year":2020},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.412788Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:137770a6094eec38de1604c53c6ccd7c804c4a72db780f8f97a3e1026a3217df","observation_id":"ad1d724f-0a8b-40d4-a0f1-338d96381689","resolution":{"observed_at":"2026-08-16T04:54:15.401782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.381761Z","title":null,"venue":null,"work_id":"41d60aa0-e814-4109-8dd0-5c870bf1862e","year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.417271Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:92be15a640cf4fbc10b9452c3f405d868161fe0a1cc47408684865626767d01e","observation_id":"770b2abc-3d1e-4920-bab1-b7e6034d2b1b","resolution":{"observed_at":"2026-08-16T04:54:15.386488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.366812Z","title":"B., Volkmann, J","venue":null,"work_id":"5822bf22-f799-45d7-ba44-b53a0c454d88","year":2007},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.421631Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:8c2bf3732ff91df45383a22000ec6ec7905c1da42a62ea47aac44b2f934b80e7","observation_id":"86f2fbbe-2e73-422d-82bb-c9ee1b033d39","resolution":{"observed_at":"2026-08-16T04:54:15.371758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-16T04:54:14.426021Z","title":"(2021), Offline reinforcement learning with implicit q-learning, arXiv preprint arXiv:2110.06169","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.426021Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:2b76c6dfc8a5f4609488f2e805611c3fd6ba0469caa4ce8a513cb1fc9bb72ff8","observation_id":"841944cf-839a-4b90-9e6d-a176aa198162","resolution":{"observed_at":"2026-08-16T04:54:14.426021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.352558Z","title":"(1989), Linear integral equations, vol","venue":null,"work_id":"a91f6d9a-62b2-4e80-944f-d35a63e52859","year":1989},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.430679Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:206b645a3deb5d5ebea880b7569548788e54c40b18d5648debf95a491a935dfb","observation_id":"8864b3c9-f08c-4ef0-a21a-8980cb3ed206","resolution":{"observed_at":"2026-08-16T04:54:15.357186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.337608Z","title":"(2020), Conservative q-learning for offline reinforcement learning, Advances in Neural Information Processing Systems, 33, 1179--1191","venue":null,"work_id":"9f974d04-3c02-4d0f-ba96-4feefdd01f39","year":2020},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.435075Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:1cf5e836235ab624cb3c2eda31e56a8ffd430baad03e2d0d25db61e80fb7c73b","observation_id":"03655345-0d94-4581-9c58-68eb06c787cf","resolution":{"observed_at":"2026-08-16T04:54:15.342241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.322851Z","title":null,"venue":null,"work_id":"5fe9d8fc-bafa-4a2c-9f87-4cb22628261a","year":2013},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.439297Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:bce8da3f768e0c21efa4f7bc2846246d0d21099579069e746c07d57410fba18d","observation_id":"8849dbc8-95c4-47ae-9032-6fe596954bd0","resolution":{"observed_at":"2026-08-16T04:54:15.327486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.307696Z","title":"(2019), Batch policy learning under constraints, in International Conference on Machine Learning, PMLR, pp","venue":null,"work_id":"b659a4ff-ef8d-4544-9e1b-b51d85630724","year":2019},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.443453Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:cc8f480eab9d8e20c8d310df9272709c03df1236da1307a2cab3769f02da568d","observation_id":"f88e3568-60d5-4d53-8989-91dbb3c9016c","resolution":{"observed_at":"2026-08-16T04:54:15.312552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.293434Z","title":"(2018), Deep reinforcement learning in continuous action spaces: a case study in the game of simulated curling, in International conference on machine learning, PMLR, pp","venue":null,"work_id":"5e98296c-5572-42a5-b314-f2a47048afb2","year":2018},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.448080Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:7769914e5dc8cd20da0734e3e33c8fe35cfc8ed21473f0e66939ed71dbf16973","observation_id":"b7f6d36c-6ed5-467d-a10f-e67b1502c283","resolution":{"observed_at":"2026-08-16T04:54:15.298204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-16T04:54:14.452593Z","title":"(2020), Offline reinforcement learning: Tutorial, review, and perspectives on open problems, arXiv preprint arXiv:2005.01643","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.452593Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:347605988279c736efc184010b1e3e340da8db0f3ef1793ef53979919a68ea27","observation_id":"8048a3b7-f55b-4017-9e54-1f6617564eb2","resolution":{"observed_at":"2026-08-16T04:54:14.452593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.04021","last_updated":"2024-12-24T05:20:59Z","snapshot_observed_at":"2026-08-16T18:40:50.639473Z","submitted_at":"2021-03-06T03:57:46Z","title":"Asymptotic Theory for IV-Based Reinforcement Learning with Potential Endogeneity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.04021","snapshot_observed_at":"2026-08-16T04:54:14.457368Z","title":"(2021), Causal reinforcement learning: An instrumental variable approach, arXiv preprint arXiv:2103.04021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.457368Z"},"links":{"cited_paper":"/paper/2103.04021","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:76457f4ad6c98072fd096c2786fff22fd41b395fe2e6695a303ecc75c1af0606","observation_id":"14bd91e6-4c14-4b02-9245-b2dc72627b3f","resolution":{"observed_at":"2026-08-16T04:54:14.457368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.277072Z","title":"(2023), Quasi-optimal Reinforcement Learning with Continuous Actions, in The Eleventh International Conference on Learning Representations","venue":null,"work_id":"b311efef-4309-46d9-82a1-fb8d8901c713","year":2023},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.462291Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:304ee56b9aecbf6f061729caaf6a6f603f65c68948ebb043d24d9d027169b977","observation_id":"70bb7568-6d3e-4162-86a0-2cb47449696a","resolution":{"observed_at":"2026-08-16T04:54:15.282669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.260450Z","title":"(2021), Off-policy estimation of long-term average outcomes with applications to mobile health, Journal of the American Statistical Association, 116, 382--391","venue":null,"work_id":"8a1014c1-458b-4196-80e2-bcbed6940da3","year":2021},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.466677Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:0827dd860916b27c7fafef35c403aa0cfa3c32908067f82a10229de4a20d5b33","observation_id":"d0436792-f256-4aa7-bdde-4aeb45b17928","resolution":{"observed_at":"2026-08-16T04:54:15.265633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.245680Z","title":null,"venue":null,"work_id":"c6a97638-fe40-4e02-b3c6-af3c06fc0416","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.470965Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:17f6ce58de27fe20cc92b8bf9ad7dbfc8850d891316da53b5dfe09d984961182","observation_id":"af9514e0-1a5c-4152-88ea-09e1ae96af7c","resolution":{"observed_at":"2026-08-16T04:54:15.250381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-16T04:54:14.475241Z","title":"P., Hunt, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.475241Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:4e6bf728ba0e9759b0f80994a1856d102735bbcf57220d4939143e908cbee6a5","observation_id":"73b4f8ed-f353-4222-9a7e-006ea9ebf242","resolution":{"observed_at":"2026-08-16T04:54:14.475241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.229794Z","title":"(2018), Breaking the curse of horizon: Infinite-horizon off-policy estimation, Advances in neural information processing systems, 31","venue":null,"work_id":"3d3cbbf3-9d69-4339-916d-8d9d3d00fcce","year":2018},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.479814Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:858f5042a3971102481431f915c7bedfbfc7b77fab5afb3aadb510a535b29758","observation_id":"0e94eefd-784f-4d04-9bfa-9acd74d2424f","resolution":{"observed_at":"2026-08-16T04:54:15.234853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13589","last_updated":"2024-04-01T04:49:15Z","snapshot_observed_at":"2026-08-16T16:57:22.544470Z","submitted_at":"2022-05-26T19:13:55Z","title":"Pessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13589","snapshot_observed_at":"2026-08-16T04:54:14.484531Z","title":"(2022), Pessimism in the face of confounders: Provably efficient offline reinforcement learning in partially observable markov decision processes, arXiv preprint arXiv:2205.13589","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.484531Z"},"links":{"cited_paper":"/paper/2205.13589","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:fa212de885b10b23f7f3405f5210aa18fa9757d6c90a6393ca94726c93fdc3b7","observation_id":"2a5f2215-1b5a-4ce8-9779-ade6115e83c1","resolution":{"observed_at":"2026-08-16T04:54:14.484531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.214990Z","title":"J., Laber, E","venue":null,"work_id":"f6b747dc-666b-49a8-9d74-2a54c51d359b","year":2019},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.489344Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:17dd3536279091129c64151c8575e8eb63564a94b9cef49247df971ecdf31bc6","observation_id":"0f8924a3-0a2d-4df5-92b6-271946ed8cb1","resolution":{"observed_at":"2026-08-16T04:54:15.219656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.199301Z","title":null,"venue":null,"work_id":"823b2019-bc3e-495a-b3b2-d5530851e64a","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.493813Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:148e535c500453eba3b35e80695913a4be7712a1e1325136abd9469f48baca4d","observation_id":"2d7fbf26-4a78-4e5b-9105-730ec6aad78d","resolution":{"observed_at":"2026-08-16T04:54:15.203969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.498384Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.498384Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:0c7ec54a097d43caa11076812e829a6dc2c9876bf3ac071461058233805ca817","observation_id":"356b302c-a8b7-4be8-aa11-789b56f312a8","resolution":{"observed_at":"2026-08-16T04:54:14.498384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.174511Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":"280136ed-4e09-4c7a-9562-4cd613b2db85","year":2015},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.503080Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:17d3cb3399d93dc87e2ce56bd9f3b826c4af596e2c7c6d9eb6947c7c67363cd1","observation_id":"93f237ba-a115-49e9-98e9-9a4756e8fc95","resolution":{"observed_at":"2026-08-16T04:54:15.179126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.159694Z","title":null,"venue":null,"work_id":"022793f7-d651-45ec-9a05-54719aee6fb0","year":2003},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.507453Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:fd45b24d9b9616db7da8a34d61420120f198466b96bf594d9f0d763b0f03534b","observation_id":"c198ad41-3aaa-4cbb-9fb4-b77187b50c60","resolution":{"observed_at":"2026-08-16T04:54:15.164405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.144444Z","title":null,"venue":null,"work_id":"5cb7784b-8a7b-4384-981a-ddfa5584cddd","year":2013},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.511795Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:49269b4d623fcd3679fdf59ec696478cd65c47bb26a9ca1fad54b2d6ffe7ce2e","observation_id":"ea625b0f-788b-4480-ac5c-fa78767a645b","resolution":{"observed_at":"2026-08-16T04:54:15.149351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.128522Z","title":"(2000), Eligibility traces for off-policy policy evaluation, Computer Science Department Faculty Publication Series, 80","venue":null,"work_id":"7be856ee-d29b-4793-aed6-199be3b05c06","year":2000},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.516271Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:79494e56a9c751b999bdb527773518838a8639ef7eef4ea3814d4f36f77014cd","observation_id":"e4a26aa4-66a6-4696-8ef2-d0abb2353646","resolution":{"observed_at":"2026-08-16T04:54:15.134256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.112980Z","title":"(2023), Proximal learning for individualized treatment regimes under unmeasured confounding, Journal of the American Statistical Association, 1--14","venue":null,"work_id":"a630ea8e-8320-43ce-a6f5-02a807af8613","year":2023},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.520939Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:cf2982c6cf049bb06720bc41741bb9421f8cbc5821c578a2a0411506a93f6674","observation_id":"eb3bbccb-0449-4776-98fa-674978f528d4","resolution":{"observed_at":"2026-08-16T04:54:15.118195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.098237Z","title":null,"venue":null,"work_id":"63d70dd1-b24b-40ef-8739-233decf7d16c","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.525416Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:5b02aa4cb778c510feb5dcaf9bfc00685291d1fcf8b1b2fa6ab5640d08326593","observation_id":"d3d81530-ba02-40af-b8b8-e5fa33af6952","resolution":{"observed_at":"2026-08-16T04:54:15.102803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.083124Z","title":null,"venue":null,"work_id":"f57861a6-8396-47c6-a6ef-79811411fb6b","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.529849Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:018fce93d5f6e3f7e39ef22f539541ad551d22119f0a04602dc2897535803be2","observation_id":"97084137-1bcb-48e2-900e-7e0333532a06","resolution":{"observed_at":"2026-08-16T04:54:15.087809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.066615Z","title":"(2022 c ), Off-policy confidence interval estimation with confounded markov decision process, Journal of the American Statistical Association, 1--12","venue":null,"work_id":"7ee674ac-fe2f-4eef-93e6-0463c243f9c7","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.534202Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:34678b360d8b058e51699e2a5ba1d9587ad5c59cc1b420c36338ca46e3a61b9a","observation_id":"07b18144-1ed5-4b4a-9859-895647d7f1fa","resolution":{"observed_at":"2026-08-16T04:54:15.071842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.051344Z","title":null,"venue":null,"work_id":"966a4c8a-b3e8-4523-8f0c-496768ffeaeb","year":2018},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.538514Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:a134e2a0c3b0e8a444b48dbbc412c58d41f464bea43e065293ac1deda71a0c50","observation_id":"8eb2c479-d3e8-497c-8163-4f098ac330b4","resolution":{"observed_at":"2026-08-16T04:54:15.056559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10982","last_updated":"2020-09-23T07:46:53Z","snapshot_observed_at":"2026-08-13T21:32:16.595182Z","submitted_at":"2020-09-23T07:46:53Z","title":"An Introduction to Proximal Causal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10982","snapshot_observed_at":"2026-08-16T04:54:14.542761Z","title":"(2020), An introduction to proximal causal learning, arXiv preprint arXiv:2009.10982","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.542761Z"},"links":{"cited_paper":"/paper/2009.10982","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:025abb5684b332e15ea4add391451c6a8d1a7b9c5868eab48e0701695c993f58","observation_id":"a206f1f6-67d3-45de-b359-cffd17e5a38e","resolution":{"observed_at":"2026-08-16T04:54:14.542761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.032853Z","title":"and Brunskill, E","venue":null,"work_id":"efc56a8e-734e-40f9-ba75-04aa597f13d1","year":2016},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.547332Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:251c501a43c9acd5414ede5ed97d7865dcf38883ebe916e5c4d699a8d21ea5d4","observation_id":"0e6742b5-5241-4b4f-b984-ea5e1d6c44f3","resolution":{"observed_at":"2026-08-16T04:54:15.037610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:15.014712Z","title":"(2020), Minimax weight and q-function learning for off-policy evaluation, in International Conference on Machine Learning, PMLR, pp","venue":null,"work_id":"2931a466-6400-4bad-9e29-3ceeb2a9ed02","year":2020},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.551671Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:27d5041e32a81aded131f9b3ad2359ce546ca69fdc31a3955752647c72a06bff","observation_id":"b22ce68a-5aad-4f34-a0d5-285f3cf0ffdd","resolution":{"observed_at":"2026-08-16T04:54:15.020578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.995815Z","title":"(2024), Future-dependent value-based off-policy evaluation in pomdps, Advances in Neural Information Processing Systems, 36","venue":null,"work_id":"c4eff9ea-25e7-4f61-8a6e-30fa4af69c1a","year":2024},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.556461Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:f85d7fa1f03365ce6b2377d782e30e0d9e1833b06d39ab23c8ee7c73c739c056","observation_id":"0b3f6020-ec07-4882-a829-8ed66983dec8","resolution":{"observed_at":"2026-08-16T04:54:15.000899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.981271Z","title":"and Groothuis-Oudshoorn, K","venue":null,"work_id":"dd576d45-855e-49b1-bb91-792871cda19f","year":2011},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.560704Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:75aee0ecbfcdd26c86fa0f820e35f972db8b603b7989377024569c0ce66d5902","observation_id":"ed0aa84a-7f48-49c7-993a-2d307ef8202c","resolution":{"observed_at":"2026-08-16T04:54:14.985762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.966268Z","title":"and Zou, S","venue":null,"work_id":"e2e4eeb0-bb48-499a-b88c-57df7dcded13","year":2022},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.565105Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:a2390ad7e6f8e731e9d1b2e8e34085d73f8fbc113e99c847b5bba5f4d228ff31","observation_id":"aff82c72-59d1-47d5-907b-b6d4222f706c","resolution":{"observed_at":"2026-08-16T04:54:14.971136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.950052Z","title":"(2019), Towards optimal off-policy evaluation for reinforcement learning with marginalized importance sampling, Advances in neural information processing systems, 32","venue":null,"work_id":"0ee98ffe-d5e0-4f1f-8347-19f0a5469f0b","year":2019},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.569342Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:3ec233a7acfc6deb27e6fb1b787c21e076f404675b14d2fe8710e5f279f28fad","observation_id":"3e1da517-73bf-45f0-a826-4367b3fdb266","resolution":{"observed_at":"2026-08-16T04:54:14.955283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.934366Z","title":"(2023), An instrumental variable approach to confounded off-policy evaluation, in International Conference on Machine Learning, PMLR, pp","venue":null,"work_id":"cd3b0e50-328e-4d81-a2f3-af915517fb45","year":2023},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.573726Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:3027d1a437c7ea1dd052efa7b9a2bb9ce060301053f4212dc10a232571679f57","observation_id":"0a1d9ce9-2d9b-4746-8d99-b9c128bb581c","resolution":{"observed_at":"2026-08-16T04:54:14.939449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.919346Z","title":"and Bareinboim, E","venue":null,"work_id":"35434ad0-9ff3-4cdd-8578-0e7d4d44bc08","year":2016},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.578035Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:e7d9d62533c24bc7c9c69e44d6d438f0c5605dc9dbb0fbacbdc32da2d190e4e7","observation_id":"b62d42a6-c9b9-4314-a023-203d356b22a9","resolution":{"observed_at":"2026-08-16T04:54:14.924013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.902199Z","title":"(2020), Causal imitation learning with unobserved confounders, Advances in neural information processing systems, 33, 12263--12274","venue":null,"work_id":"3d7d1285-80b6-4cc4-b66c-6e0a29494e63","year":2020},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.582444Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:9c299b31e32aed8602c9f1de6baab38873c14ce1a368b0b68073bc56b4b84c7e","observation_id":"686d4d10-0ba5-4f96-a399-6911a249dcc7","resolution":{"observed_at":"2026-08-16T04:54:14.907724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14703","last_updated":"2024-10-03T06:55:03Z","snapshot_observed_at":"2026-08-17T12:53:45.156482Z","submitted_at":"2024-02-22T17:00:50Z","title":"On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation","version":2},"cited_work":{"arxiv_id":"2402.14703","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14703","snapshot_observed_at":"2026-08-16T04:54:14.664692Z","title":"On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation","venue":"cs.LG","work_id":"8c4bb8c6-c8fe-4e25-9506-6d7edf6c7967","year":2024},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.586780Z"},"links":{"cited_paper":"/paper/2402.14703","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:e7da1c987ace1da8b79ba67bbf182eaa8bdf82fd8343ff24a9100ee95972802d","observation_id":"98108e71-ba89-4819-8277-83b9d4093515","resolution":{"observed_at":"2026-08-16T04:54:14.671602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.885977Z","title":"(2024), Bi-Level Offline Policy Optimization with Limited Exploration, Advances in Neural Information Processing Systems, 36","venue":null,"work_id":"8feb38cf-52ec-4bae-ab98-36c48bdb1e9c","year":2024},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.592125Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:09a3a5520d41de8af593edf3385994ec223113a88fe5c6d277162df3509a0c8b","observation_id":"a9b94b24-e0ac-4371-8991-def5ab75dc3b","resolution":{"observed_at":"2026-08-16T04:54:14.891413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.869290Z","title":"(2024 a ), Policy learning for individualized treatment regimes on infinite time horizon, in Statistics in Precision Health: Theory, Methods and Applications, Springer, pp","venue":null,"work_id":"da0b2166-744e-44fa-801d-626a7aad21bc","year":2024},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.596573Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:a7ada0899749cc6341643043f86259d0f4efc1ccd5602336df72538669963af1","observation_id":"8d09bd4e-b1cd-40e3-9026-7d253601b194","resolution":{"observed_at":"2026-08-16T04:54:14.874788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13278","last_updated":"2023-10-02T00:41:01Z","snapshot_observed_at":"2026-08-16T14:58:16.706975Z","submitted_at":"2023-09-23T06:35:44Z","title":"Distributional Shift-Aware Off-Policy Interval Estimation: A Unified Error Quantification Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13278","snapshot_observed_at":"2026-08-16T04:54:14.601000Z","title":"(2023), Distributional shift-aware off-policy interval estimation: A unified error quantification framework, arXiv preprint arXiv:2309.13278","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.601000Z"},"links":{"cited_paper":"/paper/2309.13278","citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:d15c9ef94c018697f9717473682b9fe322c3a123ec4656dd678483b40bd5673d","observation_id":"5c19e899-4c9a-4945-8ca5-103002d52080","resolution":{"observed_at":"2026-08-16T04:54:14.601000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.852338Z","title":"(2024 b ), Estimating optimal infinite horizon dynamic treatment regimes via pt-learning, Journal of the American Statistical Association, 119, 625--638","venue":null,"work_id":"b1cac3f3-2397-4f7b-a655-a6f482649ebf","year":2024},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.605462Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:6c59fbb98d2134076b811cdf823fb98062cd7921a62241053c9d397c6ce22356","observation_id":"6fe62085-e851-42d9-827b-f2b8ace0bd17","resolution":{"observed_at":"2026-08-16T04:54:14.857615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:54:14.836294Z","title":"(2020), Safe, efficient, and comfortable velocity control based on reinforcement learning for autonomous driving, Transportation Research Part C: Emerging Technologies, 117, 102662","venue":null,"work_id":"94e0f4ed-c41a-4b8b-986b-3b9289a3ba59","year":2020},"citing_paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T04:54:14.609941Z"},"links":{"citing_paper":"/paper/2505.00304"},"observation_digest":"sha256:45b206cbc6ae7ad304a462b575b03ce0667fd1abe34f2334585de54b370d35dd","observation_id":"7798237d-f28a-4154-8fe1-f5271244b8da","resolution":{"observed_at":"2026-08-16T04:54:14.841403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00304","last_updated":"2025-05-01T04:55:29Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-16T04:43:30.628166Z","submitted_at":"2025-05-01T04:55:29Z","title":"Reinforcement Learning with Continuous Actions Under Unmeasured Confounding"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":47},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2505.00304."}