{"as_of":"2026-08-13T01:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1821ae6d833391981caf11a193b6a7b9b711dc406ec140531f803afdef10e01","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:36:01.072056Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05445/citation-record","integrity":"/paper/2506.05445/integrity","json":"/paper/2506.05445/citation-record.json","paper":"/paper/2506.05445"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:05.259507Z","title":null,"venue":null,"work_id":"1e3d5019-0549-45c7-923a-ebb4d5a73fe2","year":2015},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.605339Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:feed9c5b8b3df7d246762b43ebe9109e028916a311bb078f03def2c7248cd5a0","observation_id":"9d48139d-8836-41e3-ae6b-2f8ff8f667bd","resolution":{"observed_at":"2026-08-07T10:36:05.279110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:05.208949Z","title":"and Pearl, J","venue":null,"work_id":"0301ad4f-ba7a-4335-aa93-984619a880cb","year":2016},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.665123Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:45f04456b4ff047cbcccba79b8ad7b1a950ee70a8c06d051d2d5161ae74ab61e","observation_id":"ebfad1ab-7e77-4f31-908c-554a0d59c0ca","resolution":{"observed_at":"2026-08-07T10:36:05.227641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-12T05:40:07.199512Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T10:35:56.756738Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.756738Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:d244b19f93378ed7160875e937859efc46442cceabf27cdf66a88f70a76f4ea9","observation_id":"d45b2319-f964-4499-bb6c-e92a8eae836f","resolution":{"observed_at":"2026-08-07T10:35:56.756738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:05.154738Z","title":null,"venue":null,"work_id":"a5afa958-6619-430f-b514-91c3c082f6ab","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.823275Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:9d2db10ef6010b665a156c94c17ff24393ff6c3257e91bcaa8f12e1bb033248e","observation_id":"c9389d4d-dee5-477b-bc34-d3fbf3a36cdc","resolution":{"observed_at":"2026-08-07T10:36:05.172607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:05.101399Z","title":"and Bareinboim, E","venue":null,"work_id":"7b1bfc5b-cd64-4c8e-86d8-f27e09855dac","year":2019},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.896354Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:bdb638c19fc8b51060b41db70cbce71259e429362200b25a55d7801204fada4e","observation_id":"269ca6ea-c4e5-459a-b44b-bdd72d06a58d","resolution":{"observed_at":"2026-08-07T10:36:05.126760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:05.038800Z","title":null,"venue":null,"work_id":"4649b558-407b-4603-8313-ce7cd7df42db","year":2018},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.970646Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:bea951b7ec62faa32d0524e77875dab38bb6273bcd36e509bf56f9f224c3c7ee","observation_id":"0246fd85-67da-4d61-be80-6ef066d20f43","resolution":{"observed_at":"2026-08-07T10:36:05.066815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.984355Z","title":null,"venue":null,"work_id":"bc248614-6491-4436-8cab-b845763f140c","year":2018},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.045401Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:55c26cd3129c1e801a20f1cdee784829126adf673f766366e759f3d122ace7f7","observation_id":"54e0fd50-c7ff-48b2-92bc-d12fdeea3cd7","resolution":{"observed_at":"2026-08-07T10:36:05.004765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.918805Z","title":null,"venue":null,"work_id":"ec256e15-286f-424b-bace-8647df735e62","year":2018},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.100420Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:1c67fae29d4101070d7b57a1be1c8651bde2ab75c3e503f9afe07e2811d5acec","observation_id":"bcaa6341-0c28-4e2d-b9e9-124faad92207","resolution":{"observed_at":"2026-08-07T10:36:04.944649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.835993Z","title":null,"venue":null,"work_id":"f0dafa0b-c718-48a3-89eb-0f162f5ef587","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.151008Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:4ef2ae91e4883d8a3396771bbf2d6b04bfbba4de1ea1691ecd8836f17ba98f3a","observation_id":"0db23e0e-4f18-4ba0-9a9a-f05a486d13d7","resolution":{"observed_at":"2026-08-07T10:36:04.877110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.777850Z","title":null,"venue":null,"work_id":"4dfc348f-e3bf-4f76-9a14-aaa8254ce0c4","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.207458Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:012cc8a796f63cb5c187272967d4ae374bbfdeb58dfeb5528be5612c3b2661da","observation_id":"19c2d0ed-9252-4fb4-a7f4-1523034c1e75","resolution":{"observed_at":"2026-08-07T10:36:04.794972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.720676Z","title":null,"venue":null,"work_id":"f23088ca-79da-440c-8ed0-0a9de2874d10","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.263934Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:8c1a6d90b3aedd4da54849733cb4d1ad4001ea5c5e18615d1f74eeb93cb97ad2","observation_id":"93cededb-216f-4353-96b7-e98981c165ab","resolution":{"observed_at":"2026-08-07T10:36:04.744172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.654098Z","title":null,"venue":null,"work_id":"d48d9ae2-a4fd-4958-984c-934882808ae7","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.336074Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:cdc6bb5ab739d295e9890bbba73610a80baadc3d76be16d2e63336006caf595e","observation_id":"a3c08d5c-115f-451d-aa63-d8a87d64f85c","resolution":{"observed_at":"2026-08-07T10:36:04.686487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.572876Z","title":null,"venue":null,"work_id":"120636bd-abde-42c5-8507-4d4157281386","year":2021},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.402866Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:7417e85010524da1bac54e7d833725dde625bfdf4dcc3cc6ce789ed8bf36b964","observation_id":"e26ac464-1600-40d0-a5c7-8eac7cf39a4a","resolution":{"observed_at":"2026-08-07T10:36:04.606814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.499590Z","title":"and Bareinboim, E","venue":null,"work_id":"49f144a8-52e2-49ff-960a-bec9e191441f","year":2019},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.466460Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:07391624f0864f2d4ac70b060e56c32fd1fc939b159514760b927a2dcb402353","observation_id":"1bb3ecff-3de4-4781-a77d-9f9581352569","resolution":{"observed_at":"2026-08-07T10:36:04.529392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.440717Z","title":"and Bareinboim, E","venue":null,"work_id":"5ed31898-a507-4267-a3cf-328030eb8614","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.519671Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:4c80ccfa6380ba02ee16237806d6ed10c9bed516d09801c85c87efddc896cf3c","observation_id":"1c900d36-b428-43cd-bbd6-7f6eb859d864","resolution":{"observed_at":"2026-08-07T10:36:04.470713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.364576Z","title":"P., Hunt, J","venue":null,"work_id":"05c5cf42-c1b3-407b-a233-bbe4c100eab7","year":2016},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.574314Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:139b7a3ac3dfc3a7f8c044b6fdd0f71826a100a2fd1fa05d234f780f7644eef3","observation_id":"a5195288-9cf4-4d74-8860-25e085d20bd6","resolution":{"observed_at":"2026-08-07T10:36:04.392073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T10:35:57.644181Z","title":"P., Hunt, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.644181Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:a783f98068cc684452a952ca55f8a97b18c67bd1e2b343754804712dcf032e3d","observation_id":"1f25f871-a3d6-4f61-b15e-c6f07e9ebbbd","resolution":{"observed_at":"2026-08-07T10:35:57.644181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.313591Z","title":"and Krishnamurthy, A","venue":null,"work_id":"8f7ca7ee-4484-40da-9134-d0e98f7ea492","year":2021},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.711279Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:92b93433e641ff50c4019dc22cd2e1026f910941af18e9baca2934ac3402e7b9","observation_id":"94d44d67-9b6d-4e78-b265-4a61b205d29e","resolution":{"observed_at":"2026-08-07T10:36:04.330213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11089","last_updated":"2020-02-25T18:36:31Z","snapshot_observed_at":"2026-08-08T12:29:54.109813Z","submitted_at":"2020-02-25T18:36:31Z","title":"Rewriting History with Inverse RL: Hindsight Inference for Policy Improvement","version":1},"cited_work":{"arxiv_id":"2002.11089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.11089","snapshot_observed_at":"2026-08-07T10:36:01.256639Z","title":"Rewriting History with Inverse RL: Hindsight Inference for Policy Improvement","venue":"cs.LG","work_id":"e08817fa-7463-4791-959b-ed99a29b6256","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.781252Z"},"links":{"cited_paper":"/paper/2002.11089","citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:9be931469610f3326e9ee5223bb619ce518c96ca961f0b5c62238cf80240d9d3","observation_id":"254e7504-a210-4e33-9413-903c850d747a","resolution":{"observed_at":"2026-08-07T10:36:01.307595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.239436Z","title":"V., Sima, K., and Leong, T","venue":null,"work_id":"2838514e-a664-4dcb-a657-5570a12ea1ff","year":2025},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.852453Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:c6c87653c01577797a11a5833a935631fda7f17b3af1daaf2aba20ef81c79ff8","observation_id":"100ddbe6-78c6-4a76-95b9-2d421e05afc1","resolution":{"observed_at":"2026-08-07T10:36:04.277446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.216791Z","title":"V., Fu, D., and Leong, T.-Y","venue":null,"work_id":"fa381006-886f-4e93-a286-85d9e706be08","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.918663Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:010804a123587fd077fe56ed4ee03b23c3bda0f2c3024272fdda4de8d2caee7e","observation_id":"cd705998-f34d-428b-b67f-219cefb0ea64","resolution":{"observed_at":"2026-08-07T10:36:04.223838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.191995Z","title":"V., and Leong, T.-Y","venue":null,"work_id":"c2095bb9-e1df-4536-b046-cb739cf84530","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.008523Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:6a697d0e3ce97adc13d30843cf855de860a0427aa2003e849a6f09041e7311de","observation_id":"169f980f-2cc9-41a2-b6cc-4eb0f12180f6","resolution":{"observed_at":"2026-08-07T10:36:04.201758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.159665Z","title":null,"venue":null,"work_id":"0f98a56c-30fc-4002-8664-a555c6f904f7","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.116971Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:fea2ef3ff561fedb3dff110f2d47dc7beab0b874f59018c54772dfe2432b8a19","observation_id":"08ee4ad2-093f-4500-914e-d302f1fdeed7","resolution":{"observed_at":"2026-08-07T10:36:04.173753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.122600Z","title":"and Sontag, D","venue":null,"work_id":"430b6bed-fdc6-4f34-818f-440866bccd97","year":2019},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.205073Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:3f2ec3873bbe37aaae34c999b03b776a16e706da4c9028abb1e7d61fdd7a2f39","observation_id":"cf3d0505-6724-4442-8426-b9eb59d5a31c","resolution":{"observed_at":"2026-08-07T10:36:04.138332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.090828Z","title":"o lkopf, B., R \\","venue":null,"work_id":"a6dc8cd5-4bd1-460c-93b8-865e7b073fed","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.290756Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:abf877564427a18430f52420518f68dec98fe152d3d7566f117e78d415babc8b","observation_id":"14a94d8c-10b4-4183-af31-0c2e57d9b490","resolution":{"observed_at":"2026-08-07T10:36:04.099722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.063370Z","title":null,"venue":null,"work_id":"fa2d7b49-d905-4205-ad82-1604362a2197","year":2009},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.377118Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:100a530f78c013c04e2a095ac64213591c04d218355d4978ea7cae9a5ff530ce","observation_id":"581578b9-8bdf-4b87-9b1e-d95a612d4adc","resolution":{"observed_at":"2026-08-07T10:36:04.072534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.038432Z","title":null,"venue":null,"work_id":"b50902a2-a349-4633-8d16-582aa678e8bb","year":2009},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.488977Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:4c704b3ece1dc47a68f340366490a03e3a329babdfbf79250deaa4a911becd45","observation_id":"e968b5eb-b467-4199-881c-78b8a88897fa","resolution":{"observed_at":"2026-08-07T10:36:04.045301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07536","last_updated":"2022-12-14T22:43:56Z","snapshot_observed_at":"2026-08-10T01:46:05.347200Z","submitted_at":"2022-12-14T22:43:56Z","title":"Robust Policy Optimization in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07536","snapshot_observed_at":"2026-08-07T10:35:58.559435Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.559435Z"},"links":{"cited_paper":"/paper/2212.07536","citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:e98f317ef3de27ab019f03819e2dc95c8f13aef811f7105cf5680027f9728f32","observation_id":"217fafc5-d441-4cde-a5b1-50b4c0ab6376","resolution":{"observed_at":"2026-08-07T10:35:58.559435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.015823Z","title":null,"venue":null,"work_id":"a2715f06-9de4-498e-8465-864737cb01dd","year":2023},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.624485Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:5016aba135e1ab4b66c0e0b594e47e5e0a5d882b67cef76ac73afd97d8bf02d6","observation_id":"4fc2e2ad-4e12-49c6-800c-3f5284aa57b3","resolution":{"observed_at":"2026-08-07T10:36:04.023254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.994445Z","title":null,"venue":null,"work_id":"a9c7bc1e-3663-4bfc-8d18-b8ffeedb914d","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.710725Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:ed2bd2069f50e4d0c9416975432b92b9e5eb140be3f5409e64f8b1cac9ecfe7f","observation_id":"9d0de39e-ea15-431c-b06e-bd4542495984","resolution":{"observed_at":"2026-08-07T10:36:04.000514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:35:58.897292Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.897292Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:2323a5380c8a361d028cc5573a177c3da5728e1f50a2eaa42eef7f3eb3fcd833","observation_id":"402f2e2e-4070-4651-aad8-3c837732275a","resolution":{"observed_at":"2026-08-07T10:35:58.897292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.973366Z","title":null,"venue":null,"work_id":"17965b09-14f5-4c49-8cf6-9bd6b0ac46d9","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.021496Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:ba22a802663da45eb09ea09cbe814c4a9564e831e1e7e83bb0e26d3c37ae81d0","observation_id":"48daab15-c73f-4d61-a90a-335b1c953714","resolution":{"observed_at":"2026-08-07T10:36:03.979816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.947980Z","title":"A., Mehrjou, A., Itti, L., and Sch \\\"o lkopf, B","venue":null,"work_id":"04cc396c-2778-4cd3-8fc9-68e45d58a31b","year":2021},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.121778Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:1b96a6a8348d37d77b708659cf74e57b2e9246647ade688fd7f60acf224ae939","observation_id":"8daf1743-76ff-4305-9b2c-f5d5373ddb91","resolution":{"observed_at":"2026-08-07T10:36:03.958176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:59.244632Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.244632Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:1ae082d11a205e8c817862d43daedfac44bb7c531ea6cc49da4af31e24cac947","observation_id":"c5b5fe2e-7771-4e7e-9717-807af026f026","resolution":{"observed_at":"2026-08-07T10:35:59.244632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.788212Z","title":null,"venue":null,"work_id":"d9f61e06-f073-44fc-a4ac-5effa4ebbe7b","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.407242Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:26a2849d3450017ad8998b7448d8d8fbd3902922f40d825be0c863b30a33027e","observation_id":"3352881e-78dc-4e8d-93d7-ad8bbee579a2","resolution":{"observed_at":"2026-08-07T10:36:03.864149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.562322Z","title":"V., Bhattacharyya, A., Lee, Y., and Leong, T.-Y","venue":null,"work_id":"25bb0688-33ea-4799-82e2-4ff3217656fe","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.524679Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:de0c7e23b06715769174c211ada086b781c8f904493e663e1981dca515040882","observation_id":"4fac4cf2-e0b3-47da-87f2-e820812baf33","resolution":{"observed_at":"2026-08-07T10:36:03.723703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.247156Z","title":"V., Lee, Y., Hoang, T","venue":null,"work_id":"d742ac7b-b738-46b9-837f-8116a47126ee","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.653506Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:b3485dba075d2065d50c48effcb2da998cf94d4d5d30c84634113478d743e1a1","observation_id":"d8dd8711-3e83-4881-b14d-2ab66946ff93","resolution":{"observed_at":"2026-08-07T10:36:03.388402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.060002Z","title":null,"venue":null,"work_id":"114beaa2-7b39-47f0-b3d2-8daccc7daf49","year":2021},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.776828Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:2b2be9d6734f5e15b11cd3dfe0def3db3a61c4a0ddf7a438c0d6c273cdf5ad2d","observation_id":"bfa7acdc-9448-4e86-9ce1-1a13d2e9f8a9","resolution":{"observed_at":"2026-08-07T10:36:03.121133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:59.919306Z","title":"T., and Athey, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.919306Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:17bf4ca25334a0e1bdf0d389f819b7808b0254827cf00cd757ecfb7fdbf7b766","observation_id":"1af0e510-f2e3-4913-8113-8e41f75d71a1","resolution":{"observed_at":"2026-08-07T10:35:59.919306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:02.887672Z","title":null,"venue":null,"work_id":"d6522ec0-b91f-41a8-ac80-d6f4190e78da","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.076368Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:c70008851d423fe96902842f3b1dc4693808bfd328aa7f9286ee6ae56d5265eb","observation_id":"db3c2665-14ee-4a57-9ddb-ebd1843af036","resolution":{"observed_at":"2026-08-07T10:36:02.970054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:02.699150Z","title":null,"venue":null,"work_id":"1ead71b7-2488-41c6-b670-8bd4e0a6db3a","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.191439Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:2168f25832d67358d87b071e4f5ae15067e7f4c1a4dcc42b7ef766568c4c6943","observation_id":"c0da3255-67e7-4351-81f7-c722802bac01","resolution":{"observed_at":"2026-08-07T10:36:02.787674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:02.481500Z","title":"and Bareinboim, E","venue":null,"work_id":"9dfaaa68-c542-4679-a926-556fe4333f05","year":2016},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.346427Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:805dbed9bef71b1e6084fff726d63752659e9e799bfc3c89d2d052fa3f7d0441","observation_id":"32c8258f-d0a5-4952-8da4-b8b519314caa","resolution":{"observed_at":"2026-08-07T10:36:02.590333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:02.328215Z","title":"and Bareinboim, E","venue":null,"work_id":"0dce6170-abd5-4946-b03b-0807cd70e4eb","year":2019},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.501633Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:f6685f44904786dccfdc5548cf1d8fd7ccdfef5d6d38e4886dd6ccab5f3cbc49","observation_id":"c21a2795-aca7-4916-b332-982f024c8b3f","resolution":{"observed_at":"2026-08-07T10:36:02.404749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:02.157696Z","title":"and Bareinboim, E","venue":null,"work_id":"344093e0-7815-43ca-91cb-15661c0a2c64","year":2021},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.671471Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:265702d783e45afe29cdbf2ec235a929e6735c403a3da7ad9c99426d04e9d18b","observation_id":"68da7043-9bbd-49a3-8a32-de12c8a35dec","resolution":{"observed_at":"2026-08-07T10:36:02.249365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:01.969679Z","title":"and Bareinboim, E","venue":null,"work_id":"4e56d806-a264-4ebd-b317-dc84e2d60e52","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.792691Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:7e969882a350a74ac61709343d6961ccb3af963e4fa118a2ef8bc158e29fe5af","observation_id":"23686f90-8263-4ecb-a308-ad80d9cc31a7","resolution":{"observed_at":"2026-08-07T10:36:02.052297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:01.828195Z","title":"and Bareinboim, E","venue":null,"work_id":"077e45d7-e849-4427-8d6e-a30369ac472f","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.884611Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:1f9ab89cf0d34e2bbb484f27dbfeb5779c849d6b4e456fcc8188e70ba93467da","observation_id":"0adad830-802a-444e-aef3-221fd80f7c2c","resolution":{"observed_at":"2026-08-07T10:36:01.892224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:01.652756Z","title":null,"venue":null,"work_id":"914134a6-c868-442d-8d43-ab8f907c2fb3","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.981793Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:eb3decefcf4d58a0dbf3aaf3f0cd88f75e1dcf286ebe5413e1dc92c735a1380f","observation_id":"30a6359d-8f35-45dc-9155-a15bfcea025c","resolution":{"observed_at":"2026-08-07T10:36:01.747435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:01.464095Z","title":null,"venue":null,"work_id":"259a0322-318e-4a7e-b578-8d09dff28bd8","year":2023},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:01.072056Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:6218b159ab1850475e36e976a89452e2daf093e06d2f837015ae122050f3975d","observation_id":"d1c23697-be22-4220-a151-691c6b834a31","resolution":{"observed_at":"2026-08-07T10:36:01.551087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2506.05445."}