{"as_of":"2026-08-21T16:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02d70e05d9bae786c1c451a7fa37d615ff10cb320b9168b7a8766fe9478f5b44","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T21:15:15.155369Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.14897/citation-record","integrity":"/paper/2605.14897/integrity","json":"/paper/2605.14897/citation-record.json","paper":"/paper/2605.14897"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/nature14236","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.004459Z","title":"Human-level control through deep reinforcement learning","venue":"Nature","work_id":"1ff30834-09de-4b27-9602-0bd5ea024dd0","year":2015},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:755115ad9c687e12defaa952b8b8021b72f129db085685696b1f7f387eb5bd93","observation_id":"6e64ed2e-0f41-42e3-8073-ca3d6365e2c6","resolution":{"observed_at":"2026-06-30T21:25:04.216934Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-18T13:51:14.811373+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T13:51:14.811373+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:35fdeda137e6ea6411b21734696f742d3f02f94618963c94155615bb141aa037","observation_id":"58174ec8-f1c0-4612-a104-7b29bc37cc1c","resolution":{"observed_at":"2026-07-01T14:35:46.555705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3459991","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey of reinforcement learning algorithms for dynamically varying environments","venue":"ACM Computing Surveys","work_id":"ccc2968d-e1de-4168-b9af-611183fdeab4","year":2022},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:a6422740c5457e55dcf371243392870e105296b9a63a7b61c17abac84a5f8360","observation_id":"fd7c5384-8ee9-449c-b61e-e89f5628d97f","resolution":{"observed_at":"2026-06-30T21:25:04.219570Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1146/annurev-control-053018-023825","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Tour of Reinforcement Learning: The View from Con- tinuous Control","venue":"Annual Review of Control Robotics and Autonomous Systems","work_id":"0f5fef61-31ed-4c1b-8caa-22af59311706","year":2019},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:4e6be93b7be9d5bfad239246a1c5c65a0145f054fdc28df4c7c838c8f81eb54f","observation_id":"3ac97368-8309-46be-ae22-54929c28ebb3","resolution":{"observed_at":"2026-06-30T21:25:04.223618Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.artint.2018.07.007","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Artiﬁcial Intelligence 267, pp","venue":"Artificial Intelligence","work_id":"3a25bab3-e924-4458-9446-34e93d72c57e","year":2018},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:30a88824e40ccab271c85e35943eb8c458b579c773a008c2672cd1ca86b023f2","observation_id":"9e6d0d96-8af3-46d4-a1bf-57b7308bed22","resolution":{"observed_at":"2026-06-30T21:25:04.226049Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-02T08:38:17.039254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T08:38:17.039254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5651.320827","doi":"10.1145/3205651.3208277","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Inter- pretable Fuzzy Controllers Using Particle Swarm Optimization and Ge- neticProgramming","venue":"Proceedings of the Genetic and Evolutionary Computation Conference Companion","work_id":"437de7f6-2b86-4a2a-9c4a-00c711f57470","year":2018},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:b857aa1841a5d22c577b41157b03fa67ab49adab825a9a94c7c5fa0813eeb32d","observation_id":"a7177cec-83ea-4666-8bb6-f6f3cf805d72","resolution":{"observed_at":"2026-06-30T21:25:04.214711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.980074Z","title":"Imitation-Projected Programmatic Reinforcement Learning","venue":null,"work_id":"f47a09f0-e4de-4954-b786-dce8831e21eb","year":2019},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:14d67bb1fdac5be34d0e1aaa3adf564ceb576d87ab84713ce66788661444cf23","observation_id":"cff4da1d-d48a-4377-95d6-8b30bb629495","resolution":{"observed_at":"2026-07-07T17:44:01.981252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-023-06479-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Explainable Reinforcement Learning (XRL): A Sys- tematic Literature Review and Taxonomy","venue":"Machine Learning","work_id":"8cebfc66-3aee-450c-989d-4b68fd605ea5","year":2023},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:47a7e7022961097e4c4e2384a15675240ddb0c6dc89d8f6343d0292bf5f2bfb7","observation_id":"614a61ef-4fc5-42bf-906c-4e5303ccdcb7","resolution":{"observed_at":"2026-06-30T21:25:04.221580Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09784","last_updated":"2017-11-27T15:50:50Z","snapshot_observed_at":"2026-08-15T17:22:57.726836Z","submitted_at":"2017-11-27T15:50:50Z","title":"Distilling a Neural Network Into a Soft Decision Tree","version":1},"cited_work":{"arxiv_id":"1711.09784","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.09784","snapshot_observed_at":"2026-07-04T18:40:03.563129Z","title":"Distilling a Neural Network Into a Soft Decision Tree","venue":"cs.LG","work_id":"232234d2-fe22-4cef-81f0-890bc711406b","year":2017},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"cited_paper":"/paper/1711.09784","citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:560bc3554151aa0d50dcaeab413a24959e2e03aee3c59dc8beeceb5395cb0b48","observation_id":"56705602-51b6-4329-bbf8-6d03b6861d70","resolution":{"observed_at":"2026-07-01T14:35:46.552685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-08-18T00:03:21.764059Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":"1511.06295","doi":"10.48550/arxiv.1511.06295","metadata_source":"pith","pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Policy Distillation","venue":"cs.LG","work_id":"19e844ce-da43-4244-b2fd-0cef95384b68","year":2015},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:654711ff0775d78cd8205a541854710d8c49f8ea979e507e35d5b3f054c6e1d3","observation_id":"6f3798ca-4b3a-4088-a20b-b429d944530e","resolution":{"observed_at":"2026-07-01T14:35:46.557287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.978240Z","title":"Sutton and Andrew Barto.Reinforcement Learning: An Intro- duction","venue":null,"work_id":"0a659a56-f31a-4594-a028-2e5ee63dde36","year":2014},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:4637e107ad92d153a2fc0bafc7aeba4292b0d30e20711b68dc182004aece9f73","observation_id":"ca9714d0-010e-4647-980f-05dd55e77ea2","resolution":{"observed_at":"2026-07-07T17:44:01.979533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.984298Z","title":"A Markovian Decision Process","venue":null,"work_id":"151577ff-3e8c-4832-852e-9ef6653c1889","year":1957},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:0e331201661990aea5c499b5f31f5354571045fe744bc660a20d6ce736e07362","observation_id":"bd837acc-fd69-4209-b602-6ee7cd0820e4","resolution":{"observed_at":"2026-07-07T17:44:01.985362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.998562Z","title":"A Natural Policy Gradient","venue":null,"work_id":"2bb70096-3e60-4706-b7f6-2f3125a527b2","year":2001},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:85bf3ac9b5ee2ad3f771fefad2d4a084e2f229ff8ba9a9d616df8efa52b53eb4","observation_id":"bab2020d-6b66-4662-9dac-77d549369e59","resolution":{"observed_at":"2026-07-07T17:44:01.999807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:02.000365Z","title":"Q-Learning","venue":null,"work_id":"7ae62f7c-eccb-4e71-88ab-f3f0cd5d66d3","year":1992},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:1ef3235645be4bdc974c181c21af13a89514cf877ddccb6c281cf71591411841","observation_id":"e712401e-1961-4bdc-a2ed-14f87772e000","resolution":{"observed_at":"2026-07-07T17:44:02.001396Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.991340Z","title":"Actor-Critic Algorithms","venue":null,"work_id":"6b8354e3-2ef4-4344-9181-f39db962314b","year":1999},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:a480afe12cb7646af975a0b2ae6e060e6c7f92dd797cba5d3359696614c382d4","observation_id":"66ab641a-b366-4ab0-9333-0c31905fb814","resolution":{"observed_at":"2026-07-07T17:44:01.992413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.987790Z","title":"Soft Actor-Critic: Off-policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","venue":null,"work_id":"2e00e29a-1a4e-4cb0-bc6e-87b2fbc461b8","year":2018},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:937b91e8556bb8689b2a963d59ffb894a4cfd9b7423d5eef6905c7e228499665","observation_id":"88243f76-f562-4288-8cad-b3a81492377c","resolution":{"observed_at":"2026-07-07T17:44:01.988972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:1b2cf01026391d37e71439f213cd9bab41451e8dcb006b52304d614009a5249b","observation_id":"6f5e2366-bcd3-42d4-84e8-fa41ab79cd2a","resolution":{"observed_at":"2026-06-30T21:25:04.210904Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:26.079898Z","title":"Louis, G","venue":null,"work_id":"9f349f1f-0e39-446f-8ac6-694a06c25de5","year":2026},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:0d7ad9262a9f9678fc14f7509b7a3c247f6c2d80f1ba9e0755c3824cb44c589f","observation_id":"24368217-0c3b-47a2-9a73-83079fe4aa62","resolution":{"observed_at":"2026-06-30T21:25:04.189474Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.989507Z","title":"Finding and Visualizing Weaknesses of Deep Reinforcement Learning Agents","venue":null,"work_id":"2f023117-4bc8-4e2f-9ddf-99becc0884bc","year":2020},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:2b8466c144c0741bc956de5ea5ba53c1a3618d25afee8ab5ee778bc03f03bfab","observation_id":"86200032-f168-4486-a827-612a153449e3","resolution":{"observed_at":"2026-07-07T17:44:01.990803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.992987Z","title":"Explaining Deep Adaptive Programs via Reward De- composition","venue":null,"work_id":"16722ab2-db6a-4625-804e-46df71f8f8fc","year":2018},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:9514dfb483feec9c563cb32bcbbf9b8a7a2c5b7da59da37ac54df7ca6df99e7c","observation_id":"1ef1d405-46de-4e99-843c-634af4f70b40","resolution":{"observed_at":"2026-07-07T17:44:01.994206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.994760Z","title":"Toward a Psychology of Deep Reinforce- ment Learning Agents Using a Cognitive Architecture","venue":null,"work_id":"16e8065d-a904-43fa-b32a-70a2bd7fc325","year":2021},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:0598ddf0a50efbac1cb0064100c8bd404a58ee7bacaba6de213b9f67fb2358a3","observation_id":"c48c7fd0-d3a1-4733-b378-75b20ac5e0c6","resolution":{"observed_at":"2026-07-07T17:44:01.996059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i15.33733","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding Individual Agent Importance in Multi-Agent System via Counterfactual Reasoning","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"832d4274-21e3-4879-8eb2-865dcf8fb9db","year":2025},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:179298d28e1cbde0dee80eea28379d35db2dc9723d52ee573a9652e63f90f43b","observation_id":"6162c8d2-f745-4d88-884f-6d001cbc22ff","resolution":{"observed_at":"2026-06-30T21:25:04.191962Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1984.116222","doi":"10.1109/massp.1984.1162229","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Vector Quantization","venue":null,"work_id":"c5bd14ac-09d3-479f-9c95-18779c4f7947","year":1984},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:8b52b75c40c8b0ae6222e2fb2f5ec3a8775db94065c1bdaf7360582e83822889","observation_id":"91d94687-8760-46a4-bc55-ad33e1d8596d","resolution":{"observed_at":"2026-06-30T21:25:04.207999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1002.361007","doi":"10.1145/361002.361007","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.1145/361002.361007","venue":"Communications of the ACM","work_id":"02857ec1-802d-4c51-89f5-9463eb6cf639","year":1975},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:18bca4a396895e38a4994928fe198d737b722778ee23b837805d827c80bf7ad0","observation_id":"948cd354-ef66-4b78-a158-9195026fe1bd","resolution":{"observed_at":"2026-06-30T21:25:04.208364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:23:52.670744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:23:52.670744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.986088Z","title":"Some Methods for Classification and Analysis of Multi- Variate Observations","venue":null,"work_id":"f8e62cf1-4dfa-40cf-8f30-8e6e64bfb4cd","year":1967},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:c45403a3d5df40e3b8905f47239c8a9757d0cf5eedbb2f3be8d5ef69b4d89351","observation_id":"f65e88cb-286d-49bd-a09d-8407f5b32864","resolution":{"observed_at":"2026-07-07T17:44:01.987244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9672.293977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T19:57:33.822557Z","title":"Why Should I Trust You?","venue":null,"work_id":"5903313c-55d0-4d78-92b5-46dc2775d054","year":2016},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:5e604c77724fabc6121d027040011a4365a3e39d90c474aac4d3d8b6c2815404","observation_id":"b984fde2-0fb0-4b99-b486-c6adde65adda","resolution":{"observed_at":"2026-06-30T21:25:04.194922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10045","last_updated":"2019-12-26T08:09:25Z","snapshot_observed_at":"2026-08-15T10:39:50.041286Z","submitted_at":"2019-10-22T15:27:30Z","title":"Explainable Artificial Intelligence (XAI): Concepts, Taxonomies, Opportunities and Challenges toward Responsible AI","version":2},"cited_work":{"arxiv_id":"1910.10045","doi":"10.1016/j.inffus.2019.12.012","metadata_source":"pith","pith_arxiv_id":"1910.10045","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Explainable artificial intelligence (xai): Concepts, taxonomies, opportunities and challenges toward responsi- ble ai","venue":"cs.AI","work_id":"d47d4c0c-7f58-4955-b6da-f2a5940ba35c","year":2019},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"cited_paper":"/paper/1910.10045","citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:c98c61e89da7ea2c2a5ffd9619d0c3d48a9d9c76e92a1f1d0e4acf409b084f8d","observation_id":"cbb87efd-0223-4ffa-8391-ad80d95f1518","resolution":{"observed_at":"2026-06-30T21:25:04.186501Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:39.144682+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:39.144682+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/jmse9111178","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Explaining a Deep Reinforcement Learning Dock- ing Agent Using Linear Model Trees with User Adapted Visualization","venue":"Journal of Marine Science and Engineering","work_id":"65f83b3d-33e5-47d1-a2a9-aec396b70b0a","year":2021},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:e5c0a218013876685b0d42ed32efdc01fa593372167c10bf4fd50849a50f0cac","observation_id":"ec600faf-82a8-4dbb-8b83-11f56c21a2d5","resolution":{"observed_at":"2026-06-30T21:25:04.199775Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-10928-8_25","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Toward Interpretable Deep Reinforcement Learning with Linear Model U-Trees","venue":"Lecture notes in computer science","work_id":"c55568cf-8691-448e-a383-f567a63000d9","year":2019},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:c8d489c38c5bbe42406a4a6522fb5a6376d54fc64c30ef8c2c7b5b4922e88e66","observation_id":"612c893f-3042-44fd-8c82-a940fe01ebeb","resolution":{"observed_at":"2026-06-30T21:25:04.180383Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1862.2024","doi":"10.1109/icmla61862.2024.00027","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Grantcharov, V ., Wanna, S., & others","venue":null,"work_id":"96269eaf-b09c-490a-9f48-870d0d945f96","year":2024},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:2f5e7188ed155ed41e9663f3d6e61b9875ce56e52e4b54ed2185fbd2937bfc83","observation_id":"7f20b7a4-5ec3-4025-a4c5-44bf8c41c519","resolution":{"observed_at":"2026-06-30T21:25:04.211584Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.996775Z","title":"Interpretable and Editable Programmatic Tree Poli- cies for Reinforcement Learning","venue":null,"work_id":"a1c8e50e-0653-49c4-889d-897fea26bd83","year":2024},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:996d46df7a54e4a6edfb24b8e3e6d87f2bb328b306a404b0dcebc3ceb8bbaac5","observation_id":"49684237-c15f-47f9-b606-6294251145ae","resolution":{"observed_at":"2026-07-07T17:44:01.997982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:02.001979Z","title":"Distilling Deep Reinforcement Learning Policies in Soft Decision Trees","venue":null,"work_id":"6955731f-0a91-4d75-bbea-a92550927901","year":2019},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:5589bdecac86a86268487709d3e2c5ee94ccec63dbe1ef358fcf206f31fe96ba","observation_id":"1d3a1877-44de-4128-9ab9-27f40bdb5d8f","resolution":{"observed_at":"2026-07-07T17:44:02.003244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:01.982565Z","title":"Adaptive State Space Partitioning for Reinforcement Learning","venue":null,"work_id":"99dc8474-9fe7-4d3d-b57c-27edd8deeef2","year":2004},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:8e5de9cdcd4e908121293df5584e7b4dc0e2142a411636af58e25c4dcbf96698","observation_id":"8244284e-4ac7-4350-a0f1-b9d1e901ef1c","resolution":{"observed_at":"2026-07-07T17:44:01.983744Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/iros","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T15:48:34.690559Z","title":"Li, 3d fully convolutional network for vehicle de- tection in point cloud, in: 2017 IEEE/RSJ Interna- tional Conference on Intelligent Robots and Systems (IROS), 2017, pp","venue":null,"work_id":"2060d144-df60-492a-b86e-726a41433d6d","year":2017},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:b096d84d110f96378efa9790eeb93afc31499a980d64e9e1acf5b1192cf36961","observation_id":"d72f9ac1-f924-4aff-a0ff-f28dbfa48289","resolution":{"observed_at":"2026-06-30T21:25:04.197905Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:f50a4198ba7e2ded882f7963d8ee0fc4dd30f6339ec396e1bbcf899a2ca8f143","observation_id":"7f60a866-ded5-4b7c-ae9c-3ad0fe4700ac","resolution":{"observed_at":"2026-06-30T21:25:04.202338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T01:11:44.673657Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":4,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":16,"verified_fuzzy":12},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2605.14897."}