{"as_of":"2026-08-21T14:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f10223446e992ef5652d7823b49efc2817910f9274338082a48eff9381ae480e","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:05:34.935087Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T20:52:08.062450Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T20:54:21.647943Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.14058","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14058","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implicit constraint-aware off-policy correction for offline reinforcement learning","venue":null,"work_id":"70655dae-db7b-4e69-a95a-604bd22ad8af","year":2025},"citing_paper":{"arxiv_id":"2510.01479","last_updated":"2026-05-17T15:36:55Z","snapshot_observed_at":"2026-08-14T20:00:56.108275Z","submitted_at":"2025-10-01T21:43:04Z","title":"Density-Ratio Weighted Behavioral Cloning: Learning Control Policies from Corrupted Datasets","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T20:52:08.062450Z"},"links":{"cited_paper":"/paper/2506.14058","citing_paper":"/paper/2510.01479"},"observation_digest":"sha256:60ffee6815a2181bc99f6d88d032537855de3c2bf70187815225c7f01bcaa794","observation_id":"afe72333-69ab-4fb1-9db2-b6f349c12b10","resolution":{"observed_at":"2026-05-21T20:54:21.650231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14058/citation-record","integrity":"/paper/2506.14058/integrity","json":"/paper/2506.14058/citation-record.json","paper":"/paper/2506.14058"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-15T20:05:34.859075Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.859075Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:472255d75833effd41cbb52eaf4d8325b4543f55e4f08c2d3ad6672cc5d7dffd","observation_id":"2deaca87-2bff-41fd-8f7e-860ed42a450d","resolution":{"observed_at":"2026-08-15T20:05:34.859075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.301882Z","title":"A survey on offline reinforcement learning: Taxonomy, re- view, and open problems,","venue":null,"work_id":"1532e12d-a616-4d4f-aa48-ade0df03cf25","year":2023},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.870208Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:a800c24f09e3d2ebaefb0feb5a930bef761444dafb321876850511b9beb8f2c4","observation_id":"93bc56a0-3331-482d-9605-ce882d4f0f45","resolution":{"observed_at":"2026-08-15T20:05:35.305797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.289256Z","title":"Beyond uniform sampling: Offline rein- forcement learning with imbalanced datasets,","venue":null,"work_id":"c171af01-cd3d-4771-aee1-d92af8a57184","year":2023},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.877293Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:dccdc0d96ed14ca6c77577ec3177109653dd499042bb41561c09217062c827e6","observation_id":"604314b4-3e27-4d90-8ca3-6f19d7d0d8a0","resolution":{"observed_at":"2026-08-15T20:05:35.292915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06799","last_updated":"2020-11-29T05:58:30Z","snapshot_observed_at":"2026-08-17T05:18:15.908780Z","submitted_at":"2020-09-15T00:18:34Z","title":"The Importance of Pessimism in Fixed-Dataset Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.06799","snapshot_observed_at":"2026-08-15T20:05:34.883014Z","title":"The importance of pessimism in fixed-dataset policy opti- mization,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.883014Z"},"links":{"cited_paper":"/paper/2009.06799","citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:e17d5641c678c6ff741e46b0a3ee4a53d9d7ce0792c65425826fc9a96e221549","observation_id":"236357e8-6ef3-4a9a-977a-73bbac6958dd","resolution":{"observed_at":"2026-08-15T20:05:34.883014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.276012Z","title":"A minimalist approach to offline reinforcement learning,","venue":null,"work_id":"356c2d83-4ea8-44d9-8254-a5a79a8a515f","year":2021},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.888164Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:112cf73f9623fd02a0a3392399d264af28cd96e4884dcfd19d7aca7ada7354ea","observation_id":"a8e25237-783c-40f6-ba56-904d2be06f7b","resolution":{"observed_at":"2026-08-15T20:05:35.280383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10700","last_updated":"2024-01-19T14:05:09Z","snapshot_observed_at":"2026-08-19T18:15:33.231718Z","submitted_at":"2024-01-19T14:05:09Z","title":"Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10700","snapshot_observed_at":"2026-08-15T20:05:34.892886Z","title":"Safe offline reinforcement learning with feasibility-guided diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.892886Z"},"links":{"cited_paper":"/paper/2401.10700","citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:3f4598c0c5128af91c468eb5cc859bcee9dc420998e93cbd4556dfea0910cd5d","observation_id":"e73a3f8a-57a8-4dd5-9eab-d581031347f3","resolution":{"observed_at":"2026-08-15T20:05:34.892886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.08246","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.110886Z","title":"Spectral normalization for lipschitz-constrained poli- cies on learning humanoid locomotion,","venue":null,"work_id":"9c08f198-a2bd-4508-902b-3d355c91cd3b","year":2025},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.898184Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:228841a16bda318f6fafb3a3b81d91075c77445f4e50aebcff776dc13b5a203a","observation_id":"b35471d9-ad49-46ca-9c13-3370f8286c4e","resolution":{"observed_at":"2026-08-15T20:05:35.119772Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.261819Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":"00d31d77-eca7-4df8-8909-2f69f45fce13","year":2019},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.902501Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:ce99d4128aacad2b4b2fa51d6e9ad783806a19ded53509aec3abf75d059c471d","observation_id":"eec35a7d-9d51-4cb5-bf0b-4ba930e96ecd","resolution":{"observed_at":"2026-08-15T20:05:35.265944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.246749Z","title":"Conser- vative q-learning for offline reinforcement learning,","venue":null,"work_id":"ddcbfb10-1a77-4ba3-bc76-462c9a7db53a","year":2020},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.906893Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:4cfe85cbd2d4158225ab16935ea08106f4e2aa4c08d1f930ebbd4c9c46b24add","observation_id":"c7862269-d9a3-4488-95fd-24c8c5f651ca","resolution":{"observed_at":"2026-08-15T20:05:35.252104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.230581Z","title":"Uncertainty-based offline reinforcement learning with diversified Q-ensemble,","venue":null,"work_id":"420233f0-4284-4598-893e-02328a76b233","year":2021},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.911028Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:ba68e003131ac99ef6a00ae97158078ad59fc0ed0f57c00ddea3a6e710c56fc4","observation_id":"f5c72a33-f7f0-4801-b359-a790c5ca075e","resolution":{"observed_at":"2026-08-15T20:05:35.235358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-15T20:05:34.915030Z","title":"IDQL: Implicit Q-learning as an actor- critic method with diffusion policies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.915030Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:579ce04166af6d171cd355ecff50b3f91fac5769425d2f928aafca406bce2561","observation_id":"204d28c3-6802-4fa4-b287-10233ce27d3a","resolution":{"observed_at":"2026-08-15T20:05:34.915030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.217026Z","title":"L2c2: Locally lipschitz continuous con- straint towards stable and smooth reinforcement learn- ing,","venue":null,"work_id":"50ead287-11b5-482e-bb5e-e63c710864b1","year":2022},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.919350Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:df2396de41e756f0b0b3dcdccae4f0c84b63db4e6423d92a8efc6571499afa9f","observation_id":"5be6ea27-521a-474d-bce6-e720a79165cd","resolution":{"observed_at":"2026-08-15T20:05:35.220917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.203265Z","title":"Monotonic value function factorisation for deep multi-agent reinforcement learn- ing,","venue":null,"work_id":"1e77aa47-ee6e-4f27-ab15-8c2214de5ead","year":2020},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.923283Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:8c993ffd6072f0bf8043908c9e46bc1bf1f9d2192360008b64492c1704f645ca","observation_id":"965f766b-652e-41a8-aa8a-b01fac3cd49c","resolution":{"observed_at":"2026-08-15T20:05:35.207639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.188776Z","title":"Optnet: Differentiable opti- mization as a layer in neural networks,","venue":null,"work_id":"7659ae6f-6ef8-4f5a-9c1f-e1025e9fbdaa","year":2017},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.927396Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:a05778d0381b0da3d019238d9e3df197159952bacf1d3a980b48f2582d1de965","observation_id":"9028cea8-d25d-45e6-aefa-462185e76c73","resolution":{"observed_at":"2026-08-15T20:05:35.193515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:05:35.174830Z","title":"A theory of regularized Markov decision processes,","venue":null,"work_id":"7393d401-89aa-43e4-88a4-1e96eaf26d5f","year":2019},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.931288Z"},"links":{"citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:a2fb48cbfb918327c22187b336058b325b53a6e39a204f28099f882f1c96284f","observation_id":"c596da04-9ee7-4e72-9769-113a3ebad4c7","resolution":{"observed_at":"2026-08-15T20:05:35.179110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-15T20:05:34.935087Z","title":"Offline reinforce- ment learning with implicit Q-learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:05:34.935087Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.14058"},"observation_digest":"sha256:2c0c1bdd2b554bccc5ad9e2a8b48aa7112358ed12ebb80b6bc30a020ed9417f8","observation_id":"29ba232e-c4c5-4f17-979a-8bad596bdc84","resolution":{"observed_at":"2026-08-15T20:05:34.935087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14058","last_updated":"2025-06-16T23:32:26Z","latest_version":1,"primary_category":"eess.SY","snapshot_observed_at":"2026-08-19T18:16:00.793126Z","submitted_at":"2025-06-16T23:32:26Z","title":"Implicit Constraint-Aware Off-Policy Correction for Offline Reinforcement Learning"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 1 inbound Pith citation observation for arXiv:2506.14058."}