{"as_of":"2026-08-20T15:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67dc2a7a3fa7b6612ee6477ca61b4a0ca5e8417d48ef81bee22b039121da14e5","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:16:29.925713Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.12924/citation-record","integrity":"/paper/2607.12924/integrity","json":"/paper/2607.12924/citation-record.json","paper":"/paper/2607.12924"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:19.444015Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:19.444015Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:b86619d5d48bf3590387ba797344f2dbbf31fe96e9a53392633f109e98cdb740","observation_id":"a96d4f15-4c4d-486f-8fc8-1ff09fe79671","resolution":{"observed_at":"2026-08-02T06:16:19.444015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:19.480939Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:19.480939Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:50c45db1730e89e46158d04b02caa0608ac0278054e0fd5e30d1bd0ddb56e64b","observation_id":"3dc5bfa3-2704-40c1-88d7-0791e85a07b0","resolution":{"observed_at":"2026-08-02T06:16:19.480939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:19.558912Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:19.558912Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:328a6be709398c10f2475802b65a959ada85fb528ceb5885026c76b1ae6f3021","observation_id":"8078c979-7bcc-4d8a-b8e8-08acd73d62d3","resolution":{"observed_at":"2026-08-02T06:16:19.558912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:19.634720Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:19.634720Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:83d0462a024a3a193973e6e2808f30877b7d4bb514bed17a2f66044878007568","observation_id":"35835c41-0a11-4a8a-a688-1ed4aa8a383d","resolution":{"observed_at":"2026-08-02T06:16:19.634720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.04388","last_updated":"2019-05-10T21:57:41Z","snapshot_observed_at":"2026-08-14T16:34:03.114602Z","submitted_at":"2019-05-10T21:57:41Z","title":"Multi-Pass Q-Networks for Deep Reinforcement Learning with Parameterised Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.04388","snapshot_observed_at":"2026-08-02T06:16:19.698520Z","title":"J.; James, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:19.698520Z"},"links":{"cited_paper":"/paper/1905.04388","citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:771566d07929e4b3c25a465bcda1fa2bb78ad9f0342e0cc85d97723ba0c58a52","observation_id":"ce8b05d9-9f2f-48cc-8630-6abd798d3c86","resolution":{"observed_at":"2026-08-02T06:16:19.698520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:19.773478Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:19.773478Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:2225e78fd884762a40792a3b381a283fdda0054e2afe5fc676c4890a86f09eef","observation_id":"f87c370a-9cba-433d-b6cf-238ad8bb8eb9","resolution":{"observed_at":"2026-08-02T06:16:19.773478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:19.941789Z","title":"data-hungry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:19.941789Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:b372e94b65dc965c917d2ee63ebcdaf36ec962c412bab08ac5cdb696bbcfeb93","observation_id":"a4e27dda-4282-4f84-9ecf-98343b37310a","resolution":{"observed_at":"2026-08-02T06:16:19.941789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:20.028042Z","title":"J.; Li, J.; Paduraru, C.; Gowal, S.; and Hester, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:20.028042Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:3a6408d4e1c7020f4be80b60d5a5a94fefe7f06bef4cf6420684946ad5c8ff59","observation_id":"60ea5feb-01f3-440c-9520-bced1c32d286","resolution":{"observed_at":"2026-08-02T06:16:20.028042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:20.099420Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:20.099420Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:bbc48af5e51517e73a04124304eed0e3cf4171c00c1b58bfa11804813a70d205","observation_id":"9fb323e3-776b-4437-ae55-d41466b7f6d1","resolution":{"observed_at":"2026-08-02T06:16:20.099420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:20.311841Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:20.311841Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:12badb2444914f5e8a72556a4bc3b7db8e558bf2d213ccccce8ddc0163e09bf5","observation_id":"be3e02c1-5b74-4cd5-9755-e9bb1c43c829","resolution":{"observed_at":"2026-08-02T06:16:20.311841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:20.488358Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:20.488358Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:4f0e957de46517ded90dcd576488df4f4f574a25dfcadc46ebf0e7e96067043e","observation_id":"918d3b6b-a748-49e8-9430-4734676c2faf","resolution":{"observed_at":"2026-08-02T06:16:20.488358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:20.649466Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:20.649466Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:163ff4ed776287de5f77a8ceef10f039149a79351c0d0a8184a67f65a22e5e1f","observation_id":"df943df9-9c68-481c-a845-d47ddaeedfda","resolution":{"observed_at":"2026-08-02T06:16:20.649466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:20.804208Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:20.804208Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:b7288b96e138e4ee4a36fec4b828e38f867811288a089ac0843ebb64435d6330","observation_id":"9ef2f7b3-90d8-4ec0-9eba-234b8d4c0e64","resolution":{"observed_at":"2026-08-02T06:16:20.804208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:20.977635Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:20.977635Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:c06a3403c69e2c809fa67d74b9b934194b3f7a2c2eb1b66e15b83a763f5002fa","observation_id":"5423079e-e498-467e-8fe6-a06266c21887","resolution":{"observed_at":"2026-08-02T06:16:20.977635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:21.062412Z","title":"J., and Stone, P","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:21.062412Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:69f217d69ff501a0836dede5d8b1cd201dc473b088fa00a9a72f2fa2419d0f43","observation_id":"f45041d7-5062-4094-858d-044fece5e7a3","resolution":{"observed_at":"2026-08-02T06:16:21.062412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:21.220920Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:21.220920Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:9eb76e2b980677c2affb06f9228f92af04345057687c5d173f27cb61da693819","observation_id":"7c6a1d6f-1485-4665-90bd-d882b23c12db","resolution":{"observed_at":"2026-08-02T06:16:21.220920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:21.392358Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:21.392358Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:7f55606ef4c31bd4ad549e132ad2ccf82a15b7bd0accf2fac8d7cf2f38304e6c","observation_id":"57f0c4ee-f039-45d9-9c84-10c3a22b3268","resolution":{"observed_at":"2026-08-02T06:16:21.392358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:21.514470Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:21.514470Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:d202ea965d666e77ffdaccecbb7aa8e4b1105ededf87cce3b96f70f166a1ea8d","observation_id":"85438c08-c775-4f3f-9127-f213164eff0e","resolution":{"observed_at":"2026-08-02T06:16:21.514470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:21.655508Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:21.655508Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:5697dec679fd4000144e7ba6fecf777e382a121c213e36eb29c533a04d5545ef","observation_id":"5f2a4d72-3b0f-425f-974c-37de9596fcf2","resolution":{"observed_at":"2026-08-02T06:16:21.655508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T06:16:21.979923Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:21.979923Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:0c0754779b6aa4c63c0d6d65e5d8ed586169c76292f0cd5e16548b75d2d05b48","observation_id":"9b5442d6-aba4-40ce-a811-4456d40a425e","resolution":{"observed_at":"2026-08-02T06:16:21.979923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:22.165564Z","title":null,"venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:22.165564Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:9f34570636d511edcf34fc236e7e3af0833635a1dbc40964159d487110a20f14","observation_id":"08bebbee-f6c1-4159-8e5c-7cd66d46a44b","resolution":{"observed_at":"2026-08-02T06:16:22.165564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:22.337500Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:22.337500Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:e7c21cf3f64b45b0a5bf25ab2d8cb6be080daf85a6b8ec96037013916c9dfdc0","observation_id":"27b4a562-cc1a-4164-abd1-0a23904c8994","resolution":{"observed_at":"2026-08-02T06:16:22.337500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:22.524377Z","title":"B.; and Wu, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:22.524377Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:ca6292442b6aea628eb4b2a42e44ad048e16e8b48c8f1bc30289fa91e9f298ba","observation_id":"23a88363-8bdc-4909-806e-08ba7b6bf1f1","resolution":{"observed_at":"2026-08-02T06:16:22.524377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:22.716252Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:22.716252Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:610321cf33a7bb8f3413f52792e13ae4ed0cbcbe80172f3ef013634430e4be17","observation_id":"e8a1d8a9-9865-4ab8-a90f-3ee01aa706a6","resolution":{"observed_at":"2026-08-02T06:16:22.716252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15670","last_updated":"2022-10-26T18:39:49Z","snapshot_observed_at":"2026-08-16T16:20:51.853350Z","submitted_at":"2022-10-26T18:39:49Z","title":"Knowledge-Guided Exploration in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15670","snapshot_observed_at":"2026-08-02T06:16:22.879192Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:22.879192Z"},"links":{"cited_paper":"/paper/2210.15670","citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:4976c4ad6e9b04ea330cc09280f9cc5e5b0e04992ba9b5cf5f8c0edb370dd994","observation_id":"451b72cd-fa6b-44b9-ae31-3533644bcdc9","resolution":{"observed_at":"2026-08-02T06:16:22.879192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:22.983548Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:22.983548Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:58f92de6086347601af8df23e8d7b79a81cd90bebc2f3611b112282c54d1d446","observation_id":"269ee04a-0e9a-4421-8344-1bf0d7cbcd23","resolution":{"observed_at":"2026-08-02T06:16:22.983548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:23.153134Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:23.153134Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:6fbdff085a739d527a5f716e586fd8820a39f1eecead370a6dc4acd395e73998","observation_id":"d835f6e5-1116-4615-97cf-d9d329787255","resolution":{"observed_at":"2026-08-02T06:16:23.153134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:23.215896Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:23.215896Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:1366d8236e967769f61822906bf34bf7140fb0a5dc109934ff32c67a22a27b9e","observation_id":"4326291d-7bf1-4731-8e00-ea0ad9c8bbca","resolution":{"observed_at":"2026-08-02T06:16:23.215896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:23.339290Z","title":"A.; Veness, J.; Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:23.339290Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:31c2a11965fd8af5effe3d84775fc19c3e779cb0a5dabb55ba2bfd102982167c","observation_id":"80444a42-96e7-49e4-bcc2-a8fe6f385efb","resolution":{"observed_at":"2026-08-02T06:16:23.339290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:23.475080Z","title":"M.; Broekens, J.; Plaat, A.; and Jonker, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:23.475080Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:c56c863d79ad9525c5b96ab3ceabeec79f5a9da1570143bc9d5988553de8bf55","observation_id":"fac7cb76-e5e9-4d1b-9cf3-4cd4aa5649bd","resolution":{"observed_at":"2026-08-02T06:16:23.475080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:23.608300Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:23.608300Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:e2decf5cb71171b1adce458551b26a4490bd4d63cd782f92d725e9870fa0ffac","observation_id":"561bd2d6-8844-4fae-ae3c-125243bbfb4b","resolution":{"observed_at":"2026-08-02T06:16:23.608300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:23.688353Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:23.688353Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:d6a872f1036a31a9066638986c9d2af7d0f6c6e9d0bf6c2ad036e00bf4e3d2c7","observation_id":"91953609-23a7-4ee6-b20b-5b4c9c6bb8fe","resolution":{"observed_at":"2026-08-02T06:16:23.688353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:23.733220Z","title":"S., and Barto, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:23.733220Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:0bc7d1a17f37cc22e5550c63317c5f4ad0a719e9f0e4b8611af7c77a5635b9ea","observation_id":"87d6f797-e2fb-40b5-9509-48c65f1fe487","resolution":{"observed_at":"2026-08-02T06:16:23.733220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:23.790550Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:23.790550Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:84751c8e629c117358c96691c4a3411868f242534ec540014f1acf580bbcc35e","observation_id":"4e56d103-0d48-41f6-8c1b-6f4e62d7658d","resolution":{"observed_at":"2026-08-02T06:16:23.790550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:23.891998Z","title":"S.; and Niggemann, O","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:23.891998Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:47df09a00af231c54a626847fddf4fbc78681a42f65e0d50c291971d21c648dd","observation_id":"3eea92e5-a730-4043-b1f1-7c50dd87108e","resolution":{"observed_at":"2026-08-02T06:16:23.891998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:24.003850Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:24.003850Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:b5cb25a98a91109e8fb4f68815682ab70e0a2e2084421adb1fae4c0427cc301f","observation_id":"3381eb43-e10c-46f3-b64b-22f4fc8e7de9","resolution":{"observed_at":"2026-08-02T06:16:24.003850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:24.136790Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:24.136790Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:a8bee2e1e342fca66d8fc6f328fed62faba82f210253dbf934d06499263230c0","observation_id":"1fb530e4-e3d6-49ea-8d8b-971a5eb84db9","resolution":{"observed_at":"2026-08-02T06:16:24.136790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:24.272334Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:24.272334Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:23d320df55ede8d44e1edf05bc25a427684dcef5527a28ac1d0fa53dec80e9f7","observation_id":"b7985c58-66c0-4960-ae84-dfdf34c16574","resolution":{"observed_at":"2026-08-02T06:16:24.272334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:24.431436Z","title":"Proceedings of the 34th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:24.431436Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:71016c06a585944adc288d8be2fa8b78237803fd96afd0871c2d28c7fb00980f","observation_id":"f4ff7624-8ce6-48e6-b3c9-5e7f4dea3a9b","resolution":{"observed_at":"2026-08-02T06:16:24.431436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:24.590486Z","title":"Safe Reinforcement Learning via Shielding , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:24.590486Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:7ad35b3e4d36d02773069ebd011d63297311e9d916cd474962cb5c07d60b907a","observation_id":"992ebebe-d565-4898-9526-54f6fe02cf9b","resolution":{"observed_at":"2026-08-02T06:16:24.590486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:24.788631Z","title":"Neurosymbolic Reinforcement Learning with Formally Verified Exploration , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:24.788631Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:0b1d0070095dad34fe49548413f044429bc320d710b5ea657e72f25490e54177","observation_id":"47475d88-02c8-48f7-8dd3-af0f3de0cad1","resolution":{"observed_at":"2026-08-02T06:16:24.788631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/s0269888918000188","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of learning planning action models , volume =","venue":"The Knowledge Engineering Review","work_id":"265aef5e-ec37-4390-8bf6-b6340ab6d5a2","year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:24.958560Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:08742c4e18c2d5846ea5b80156ccfb4aff52397a17c1eca84826a180f20d95f6","observation_id":"e221cde2-a9b0-4700-a659-241645727dea","resolution":{"observed_at":"2026-08-02T06:18:28.656625Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.04388","last_updated":"2019-05-10T21:57:41Z","snapshot_observed_at":"2026-08-14T16:34:03.114602Z","submitted_at":"2019-05-10T21:57:41Z","title":"Multi-Pass Q-Networks for Deep Reinforcement Learning with Parameterised Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.04388","snapshot_observed_at":"2026-08-02T06:16:25.077337Z","title":"and James, Steven D","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:25.077337Z"},"links":{"cited_paper":"/paper/1905.04388","citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:6bf171de8be0b8f97b1e620c7173290013f4425549c7b2a3468b550a79ffdd7b","observation_id":"c304ca6e-aadc-422d-aaee-4fbf4eee039c","resolution":{"observed_at":"2026-08-02T06:16:25.077337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:25.192724Z","title":"and Moré, Jorge J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:25.192724Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:4d8f82c1e23e40e1abc4b454afdfb15005f31ca01ddcb8843684e974602782b8","observation_id":"79a79fca-b125-4c28-8e3f-6dbd3ff88a7b","resolution":{"observed_at":"2026-08-02T06:16:25.192724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3645103","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Symbolic Knowledge Extraction and Injection with Sub-symbolic Predictors: A Systematic Literature Review , volume =","venue":"ACM Computing Surveys","work_id":"3e4da3ef-786e-4fe1-bd5b-5760b1f9b8ae","year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:25.306105Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:cf4b6799eb41e7e725e9581ac56e933fb612fcb56e806f31fe3926a27e535f4f","observation_id":"560045bf-1543-4dd2-a646-c1f6a84ea73f","resolution":{"observed_at":"2026-08-02T06:18:28.466446Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-2279","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data-hungry","venue":null,"work_id":"ea679c22-853f-4b52-a3d2-32d8194ec384","year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:25.404038Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:0ad3f5c1380874ed23c9a3f1b49bc529ce8d103b36fbc8459751d3cac22ea092","observation_id":"d1e4d12e-d6fb-49d5-add2-624d34d4268e","resolution":{"observed_at":"2026-08-02T06:18:28.259437Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:25.514244Z","title":"and Li, Jerry and Paduraru, Cosmin and Gowal, Sven and Hester, Todd , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:25.514244Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:69518b1bb9bb7b4f7ba93e30192d04296576279e92ebbabc86719b4c3760ea73","observation_id":"779befcc-7b3f-4535-86be-1efc7230512e","resolution":{"observed_at":"2026-08-02T06:16:25.514244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:25.629556Z","title":"Proceedings of the ECAI Workshop on AI-based Planning for Complex Real-World Applications (CAIPI 2025) , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:25.629556Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:70299b3c56b6d75432f9b08cd642eb59626dc7b85f0513508ad010cca9cf6cb9","observation_id":"f000c661-7d86-4194-835e-539452f0a346","resolution":{"observed_at":"2026-08-02T06:16:25.629556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:25.704991Z","title":"Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:25.704991Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:c394e510131dd4b2baaa6d0bb5d767e10175434eccccb79e311ac935a7fb9a0e","observation_id":"1cee0515-d49d-48c6-a0ea-a44492009ef1","resolution":{"observed_at":"2026-08-02T06:16:25.704991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:25.887044Z","title":"Adaptive Shielding via Parametric Safety Proofs , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:25.887044Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:33a898a4b4297269585a988a9690d1246dfd55f2a35d18e16ca5187e378ae1db","observation_id":"122aad10-f1f9-4094-b765-e997a262a661","resolution":{"observed_at":"2026-08-02T06:16:25.887044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:26.036285Z","title":"Proceedings of the 36th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:26.036285Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:8b1b1683d766234946446658088081f3b60b8d269975604c38383bb0a9e505e1","observation_id":"951ffbf3-47d9-4571-907e-f21fc5d9b83d","resolution":{"observed_at":"2026-08-02T06:16:26.036285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v32i1.12107","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Safe Reinforcement Learning via Formal Methods: Toward Safe Control Through Proof and Learning , volume=","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"eb476d98-6f3a-404f-8aac-6b33f4b36c58","year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:26.129164Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:e2190ea33f6bc4c5369e3456edb261a0eb4f914108f61b0565f7a5b9e36cd4c8","observation_id":"a035d244-546a-4870-8fab-d26738e2c81c","resolution":{"observed_at":"2026-08-02T06:18:28.001108Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10489-021-02449-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using ontology to guide reinforcement learning agents in unseen situations: A traffic signal control system case study , volume =","venue":"Applied Intelligence","work_id":"f962c437-ce60-44ad-9922-38299babae88","year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:26.240893Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:cdc5ac6be6924c6334b9c4f9597763516864a841c2a5b063acce2aa12289a8bc","observation_id":"e97f83c0-42ad-471b-a34d-24c238010ca5","resolution":{"observed_at":"2026-08-02T06:18:27.695250Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:26.410190Z","title":"Hausknecht and Peter Stone , editor =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:26.410190Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:fb84136cf4289adfab0be481bbb98c6ce1ddc60f0419cb4f9f12f9f7a7504f41","observation_id":"7ada9c0f-48e0-463a-9c55-e537abfa362e","resolution":{"observed_at":"2026-08-02T06:16:26.410190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.65109/jwph6906","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neuro-symbolic Action Masking for Deep Reinforcement Learning , year =","venue":null,"work_id":"481f4a4a-5b41-4f27-8bbf-e3662bf6687a","year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:26.628297Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:e1093aa4473e6152e273867a7d6af9a1ad0e0ada700614e5509f47e208ca6825","observation_id":"3bed9127-f4eb-4c48-b31b-b39b394049d6","resolution":{"observed_at":"2026-08-02T06:18:27.461124Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3233/faia241000","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Lazy Approach to Neural Numerical Planning with Control Parameters , ISBN =","venue":"Frontiers in artificial intelligence and applications","work_id":"2da9f6d4-84be-403e-86f3-7823065aa62b","year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:26.775548Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:545e687b15591c4d314cbf734a5bf697833cd4b1287706797d3f623e73e12cbe","observation_id":"f3815475-323d-41ad-bb2c-37c14110fe14","resolution":{"observed_at":"2026-08-02T06:18:27.165978Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:26.910657Z","title":"Proceedings of the ECAI Workshop on AI-based Planning for Complex Real-World Applications (CAIPI 2025) , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:26.910657Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:7cea5b55e1c2cd511d90aef4435fd510f0ad5c5a82bd1a6e8ad1e59f332b5c30","observation_id":"a585880f-dbf6-47e0-81c1-aada86032a37","resolution":{"observed_at":"2026-08-02T06:16:26.910657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:27.059896Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:27.059896Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:d6e1e1fe116fd180639d644b8252c4021fc415f2ed72b8e80a95cf6b00efac0c","observation_id":"f177cc4d-d0ec-4d79-b29e-fac52d2edcad","resolution":{"observed_at":"2026-08-02T06:16:27.059896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:27.130097Z","title":"Shield Synthesis for Reinforcement Learning , ISBN =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:27.130097Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:dfdf1e6810df34376cd9028875395782253a743ed777593c9a0dba10b83571ea","observation_id":"ba70b725-516b-407c-b7bd-582019a71520","resolution":{"observed_at":"2026-08-02T06:16:27.130097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:27.202300Z","title":"Shields for Safe Reinforcement Learning , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:27.202300Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:72f728560806c7d3ff843ce436fd0331405d3b0fddebae6fa4d83828ab6f0d2f","observation_id":"fa150aa4-8cba-4c5e-83b0-e7a9e87d865e","resolution":{"observed_at":"2026-08-02T06:16:27.202300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:27.275990Z","title":"ICAPS Workshop on Explainable AI Planning (XAIP) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:27.275990Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:6e2a18045ae1a87d3be232a792290d846b7938345c18a6342a0e6008ed8f797e","observation_id":"42223e18-61e3-4197-8074-54c8d05d5b4a","resolution":{"observed_at":"2026-08-02T06:16:27.275990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00904","last_updated":"2020-05-02T19:04:12Z","snapshot_observed_at":"2026-08-13T09:09:32.362636Z","submitted_at":"2020-05-02T19:04:12Z","title":"The ILASP system for Inductive Learning of Answer Set Programs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00904","snapshot_observed_at":"2026-08-02T06:16:27.401938Z","title":"arXiv preprint arXiv:2005.00904 , year=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:27.401938Z"},"links":{"cited_paper":"/paper/2005.00904","citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:9adf2b0380da212110fe54b06b9b5eba9410000e95d2b3de44ddeab7dcfe46a9","observation_id":"84b6a43e-4df7-48a0-bd97-4dfa51c0d2e2","resolution":{"observed_at":"2026-08-02T06:16:27.401938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T06:16:27.569876Z","title":"doi:10.48550/ARXIV.2005.01643 , author =","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:27.569876Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:3cf424150ddb3699e541786c92f0e34b9262a306caa9d6af9ac9c7c21cb5cb06","observation_id":"6ea3b983-0169-4d32-b2c4-1e5231a0f3cf","resolution":{"observed_at":"2026-08-02T06:16:27.569876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:27.694741Z","title":"and Polyak, B.T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:27.694741Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:6e1d179c2ba22b540ae1260120bc6ac21e5b7e7fb49402c858d4a3ad82d81f8c","observation_id":"b438d2ee-9b71-4756-8c27-276e9ca971a2","resolution":{"observed_at":"2026-08-02T06:16:27.694741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:27.813781Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:27.813781Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:1a3ad04f16a3515569b28695550823405d6c2cedaf31256f16eb49e3ce67698c","observation_id":"604c1204-0829-42c5-b9a8-9c6cde9f9dda","resolution":{"observed_at":"2026-08-02T06:16:27.813781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:27.967488Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:27.967488Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:da42edc86da9ef650c5ae041597d7dd12dec1df6e46e5be7575e5684af65ed17","observation_id":"57cf1f45-c90b-41a9-9b9c-55f7fb9abaab","resolution":{"observed_at":"2026-08-02T06:16:27.967488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:28.074111Z","title":"Reinforcement Learning with Parameterized Actions , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:28.074111Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:88ee6d3e6f89fb8cbe6d52b752d0d2adb9dd8e7e19d84e29aa351de8ed939ed8","observation_id":"4dad749b-3201-498c-92ba-6dddda2f6c0d","resolution":{"observed_at":"2026-08-02T06:16:28.074111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:28.180794Z","title":"Proceedings of the 2023 International Conference on Autonomous Agents and Multiagent Systems , year =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:28.180794Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:305c2062fa0b22192ee43dcf0f044bd5fc8d4b489ceee5eaaec902a0ba475d92","observation_id":"d3cb9ad3-dcff-461d-bb02-cc607587e66d","resolution":{"observed_at":"2026-08-02T06:16:28.180794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.15826","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Logic Specifications for Policy Guidance in POMDPs: an Inductive Logic Programming Approach , volume =","venue":"Journal of Artificial Intelligence Research","work_id":"0c1be38b-41c2-47e6-a9f6-2502a355c55f","year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:28.321484Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:e92233144d01c780c9ae44a08c7b8db41307d6cd506ff92821fd9c0025eab5d7","observation_id":"0f9e25bf-d952-4d3c-8e66-38d4fc7ee8de","resolution":{"observed_at":"2026-08-02T06:18:26.868858Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15670","last_updated":"2022-10-26T18:39:49Z","snapshot_observed_at":"2026-08-16T16:20:51.853350Z","submitted_at":"2022-10-26T18:39:49Z","title":"Knowledge-Guided Exploration in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2210.15670","doi":"10.48550/arxiv.2210.15670","metadata_source":"pith","pith_arxiv_id":"2210.15670","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Knowledge-Guided Exploration in Deep Reinforcement Learning","venue":"cs.LG","work_id":"05123663-d28c-4042-889f-809881f32eff","year":2022},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:28.549326Z"},"links":{"cited_paper":"/paper/2210.15670","citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:8dc02d6a14142834375dcb609d7b3759bc7402901140f3dbe8169b803d7306ef","observation_id":"7d4e75d7-d900-4e54-80db-dd11873a4df3","resolution":{"observed_at":"2026-08-02T06:18:26.576456Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:28.648918Z","title":"Explainable Reinforcement Learning: A Survey and Comparative Review , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:28.648918Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:ef376395c825faafb7c53f0668a1f83e1525968ac6e32b6d4f38deff6b18825f","observation_id":"dc257678-15f4-45ae-bf05-9d65b10fce5d","resolution":{"observed_at":"2026-08-02T06:16:28.648918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:28.669550Z","title":"and Veness, Joel and Bellemare, Marc G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:28.669550Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:496d1b4a6ca682abeca0f909ee0c59f0451a35ace310de22edaf3963aa5ce2ed","observation_id":"0697f083-79e2-4358-9872-9be75676e8ce","resolution":{"observed_at":"2026-08-02T06:16:28.669550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v37i10.26424","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Safe Numeric Action Models , volume =","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"97260ab9-f93f-4cde-b9fb-940ef25e93e5","year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:28.805897Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:8eaa1debaf4f5dc39b6c03ec1688dbd6d40bbf23a7185e0dbcd5bfda264b9982","observation_id":"4f33fa6c-9036-415c-b4b2-9913daadbdf8","resolution":{"observed_at":"2026-08-02T06:18:26.271528Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:28.916245Z","title":"and Broekens, Joost and Plaat, Aske and Jonker, Catholijn M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:28.916245Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:16660d32230bb0f3490fe362a9045d589ac151175888e8ffc6bba80dcc4c4134","observation_id":"0c845f05-4996-46cb-8f8a-d11cd1b1e138","resolution":{"observed_at":"2026-08-02T06:16:28.916245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:29.095114Z","title":"Mastering the game of Go without human knowledge , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:29.095114Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:6366a52cd2cbd5424b22ccbbe6bcbb48cdca9514982ca36d9be41d08c0fc5325","observation_id":"9f4442bf-8f33-43f3-abdd-a8a5b53ca883","resolution":{"observed_at":"2026-08-02T06:16:29.095114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:29.234694Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:29.234694Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:8687a73ec777953859d3d2a9b1b2b9787330ac558dd0aceff279df2bf0450d17","observation_id":"fb08ccc2-b2ec-4b55-94e6-d7c9053b5eb0","resolution":{"observed_at":"2026-08-02T06:16:29.234694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:29.294079Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:29.294079Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:fb8a354a2315b25755e23720662ebf8ed3a82448683f4489114bea165e15fe44","observation_id":"099a3f27-6003-4204-8cb5-176d26418cd5","resolution":{"observed_at":"2026-08-02T06:16:29.294079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02850","last_updated":"2026-04-10T09:49:22Z","snapshot_observed_at":"2026-08-11T07:20:53.848967Z","submitted_at":"2026-01-06T09:28:53Z","title":"Sample-Efficient Neurosymbolic Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02850","snapshot_observed_at":"2026-08-02T06:16:29.386639Z","title":"doi:10.48550/ARXIV.2601.02850 , author =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:29.386639Z"},"links":{"cited_paper":"/paper/2601.02850","citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:9732d4864b3fa0679cf50c7ce352fa7c14af34e99c3b116e561c1787c5623714","observation_id":"cdc73c9d-f5f0-4e1c-8755-31b746536327","resolution":{"observed_at":"2026-08-02T06:16:29.386639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:29.493025Z","title":"35th International Conference on Principles of Diagnosis and Resilient Systems (DX 2024) , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:29.493025Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:c4d59fd620ba90a08dede9bc9d804a718c144ad61b1986412137ffa75243398c","observation_id":"635f1335-3841-41b9-89cd-efcbcfb9fb12","resolution":{"observed_at":"2026-08-02T06:16:29.493025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:29.534594Z","title":"Scalable Planning with Tensorflow for Hybrid Nonlinear Domains , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:29.534594Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:242a07836042a005639f8d5f92c60530f23844d64f5ba5e30d8818e33f8a9975","observation_id":"5f576683-d002-4caf-9902-fb5c2d8f6ff0","resolution":{"observed_at":"2026-08-02T06:16:29.534594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06394","last_updated":"2018-10-10T07:38:44Z","snapshot_observed_at":"2026-08-14T18:16:55.156411Z","submitted_at":"2018-10-10T07:38:44Z","title":"Parametrized Deep Q-Networks Learning: Reinforcement Learning with Discrete-Continuous Hybrid Action Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.06394","snapshot_observed_at":"2026-08-02T06:16:29.630219Z","title":"2018 , copyright =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:29.630219Z"},"links":{"cited_paper":"/paper/1810.06394","citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:a78ebae4f0bcd66db3740d9df2a7779e3adfffb6082ded695fd377caa97f64b2","observation_id":"b208660a-98ef-4f51-8e7e-9db66ce85f45","resolution":{"observed_at":"2026-08-02T06:16:29.630219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2018/820","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards Sample Efficient Reinforcement Learning , url =","venue":null,"work_id":"18fe8eb9-3286-468c-a3c8-af5b1be0eb18","year":2018},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:29.734104Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:3a48933c3f8329f76631678f42f6b79774baa8f01dc68da48f8354fe4bd3b17d","observation_id":"d92f5e27-9ed6-4433-984c-23bc4131e333","resolution":{"observed_at":"2026-08-02T06:18:25.930208Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:16:29.846227Z","title":"An Overview of the Action Space for Deep Reinforcement Learning , DOI =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:29.846227Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:fc0866712db8adca889ffc5d567851be50fc6f532170e179794eb8d05d802cbb","observation_id":"c8795eb2-fc94-49b1-9d7e-db6c3f8384be","resolution":{"observed_at":"2026-08-02T06:16:29.846227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.artint.2017.01.004","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model-lite planning: Case-based vs","venue":"Artificial Intelligence","work_id":"36681a69-29c4-43fa-8af6-ea00bb3ba6df","year":2017},"citing_paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-02T06:16:29.925713Z"},"links":{"citing_paper":"/paper/2607.12924"},"observation_digest":"sha256:63b1c16c4ae59e64d2840cc6d8c800405c705596d7cec8e7c6e9f0f77bf98793","observation_id":"08161f32-55c0-462b-8fc2-95cea9a50f10","resolution":{"observed_at":"2026-08-02T06:18:25.607267Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.12924","last_updated":"2026-07-15T08:26:39Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T06:55:46.076480Z","submitted_at":"2026-07-14T15:57:25Z","title":"Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":72,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2607.12924."}