{"as_of":"2026-08-18T11:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b6df217f208e147966be4eadfce0074b75eec6f1ddd8323eeab59c63aa78fce","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:21:12.730681Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16995/citation-record","integrity":"/paper/2506.16995/integrity","json":"/paper/2506.16995/citation-record.json","paper":"/paper/2506.16995"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-15T19:21:12.593800Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.593800Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:a8e88b8a6223a34b394a28f8319143e4d247cf490f871c2684d41a9ded6de701","observation_id":"ca57c22c-5d3a-46b6-bd4f-ab6757cc2ec8","resolution":{"observed_at":"2026-08-15T19:21:12.593800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.194343Z","title":"Superhuman ai for multiplayer poker","venue":null,"work_id":"76ef3344-f541-49b6-a364-91c2c7db01b3","year":2019},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.599247Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:b625409fc42e0bfd7121dfe3b2f75f4cd94c93390a1c140bd5f5afa7cf2e3ee0","observation_id":"02195ccc-98cc-4a8f-9f14-c9a707d2b8ce","resolution":{"observed_at":"2026-08-15T19:21:13.198763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.180163Z","title":"Nvidia redefines game ai with ace autonomous game characters, 2025","venue":null,"work_id":"a1588f8f-576f-4522-9b5f-1dc22727fb7a","year":2025},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.603625Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:5146e17b521c12014f45d9ebd1b272c736084afa0a96ca6faacd6c8efe26b080","observation_id":"d4c915ad-951e-491c-ae5c-82dd43426633","resolution":{"observed_at":"2026-08-15T19:21:13.184902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.01561","last_updated":"2018-06-28T06:54:39Z","snapshot_observed_at":"2026-08-14T19:48:45.374287Z","submitted_at":"2018-02-05T18:47:30Z","title":"IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.01561","snapshot_observed_at":"2026-08-15T19:21:12.608395Z","title":"IMPALA: scalable distributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.608395Z"},"links":{"cited_paper":"/paper/1802.01561","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:686d6f29dad81c8c7909f207dc9bdfd76d904ecee9afc379580b00d6a42800c2","observation_id":"5115219d-98dc-4a69-9215-f9a14cf93b5a","resolution":{"observed_at":"2026-08-15T19:21:12.608395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:12.613322Z","title":"Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.613322Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:4d89c4d96d1672c7731a6bc001eeb04e24dcf0bac6b04480b6d9a9864a7cc367","observation_id":"2ef97c96-828f-430e-a05e-cec82b9bedd9","resolution":{"observed_at":"2026-08-15T19:21:12.613322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03732","last_updated":"2017-11-22T21:18:31Z","snapshot_observed_at":"2026-08-14T22:29:17.225176Z","submitted_at":"2017-04-12T12:44:37Z","title":"Deep Q-learning from Demonstrations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.03732","snapshot_observed_at":"2026-08-15T19:21:12.617446Z","title":"Agapiou, Joel Z","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.617446Z"},"links":{"cited_paper":"/paper/1704.03732","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:404e3878c12668ef362c73a2b11223cd7826de3b467c445f2ee3988fb40965cc","observation_id":"8950b764-6685-4552-b0d6-b2502472311b","resolution":{"observed_at":"2026-08-15T19:21:12.617446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03476","last_updated":"2016-06-10T20:51:29Z","snapshot_observed_at":"2026-08-14T21:53:15.131684Z","submitted_at":"2016-06-10T20:51:29Z","title":"Generative Adversarial Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.03476","snapshot_observed_at":"2026-08-15T19:21:12.622735Z","title":"Generative adversarial imitation learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.622735Z"},"links":{"cited_paper":"/paper/1606.03476","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:5a6b97604021748ac3505e84623c47234910f7395a95e2ca9c705cb67702ae7b","observation_id":"8cbbe87a-8ed4-49a0-8cd9-5b0668970259","resolution":{"observed_at":"2026-08-15T19:21:12.622735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.156031Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":"74819d6e-71b7-4d7f-901b-8f6911d4a819","year":2002},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.627338Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:324833dd3de2ea422c78af807d9dffc42a7cf846badce03b27b3f9f2c4e3f699","observation_id":"5de823e1-9b42-46d7-a430-401aa717c47a","resolution":{"observed_at":"2026-08-15T19:21:13.160736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.141150Z","title":"Policy optimization with demonstrations","venue":null,"work_id":"98c6d125-3d11-4917-a692-6ae147a7187d","year":2018},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.631657Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:ba74288e31c496639c8a35832475b73b860710e68bac38c193bfb251817e15a2","observation_id":"126ecc27-9a9e-4d8d-a420-07c3e5a03ae1","resolution":{"observed_at":"2026-08-15T19:21:13.145999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-17T05:44:04.325551Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-15T19:21:12.635900Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.635900Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:5d3decc67e809b87e08d97f6defd49adeb3fb761090baa9f5855b124913f543f","observation_id":"7c2a69dd-b3d0-4887-ba38-886e15e34db2","resolution":{"observed_at":"2026-08-15T19:21:12.635900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.125683Z","title":"Method for constructing artificial intelligence player with abstractions to markov decision processes in multiplayer game of mahjong","venue":null,"work_id":"54650c4d-5250-41a2-b38b-bbf916363f8d","year":2021},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.640727Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:011489438e3f22097c08bf487ce0bedd8fec6b12624a095c70108e4cc93d2892","observation_id":"c3a91af9-3366-4d28-97e0-31004a5c2463","resolution":{"observed_at":"2026-08-15T19:21:13.130920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.111008Z","title":"A unified game-theoretic approach to multiagent reinforcement learning","venue":null,"work_id":"14ddc0b8-3a43-4369-9d1b-1461b1272e9d","year":2017},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.645328Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:86dd3937f701cbc7b03d81faa2bfafeef457d737c5b2b9648d440fdf1f13e2a9","observation_id":"78678a86-7a7c-4c24-8e98-06a005ec0a9d","resolution":{"observed_at":"2026-08-15T19:21:13.115449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.13590","last_updated":"2020-04-01T03:46:55Z","snapshot_observed_at":"2026-08-14T21:48:38.430155Z","submitted_at":"2020-03-30T16:18:16Z","title":"Suphx: Mastering Mahjong with Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.13590","snapshot_observed_at":"2026-08-15T19:21:12.649716Z","title":"Suphx: Mastering mahjong with deep reinforcement learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.649716Z"},"links":{"cited_paper":"/paper/2003.13590","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:e45c0953ea55b27e229f9bbb15cf8026f976c54bbbc5c139dc64aaa14828c713","observation_id":"087fd091-e809-47ce-9b97-90610e49ba26","resolution":{"observed_at":"2026-08-15T19:21:12.649716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.096596Z","title":"Official international mahjong: A new playground for ai research","venue":null,"work_id":"bab20f7b-fdee-44a4-bb57-05d54c4e9db0","year":2023},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.654526Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:3ffeab0fa24614a2c9b5d5982613c34605ec5bbe39bdbda4769ba36d8890946b","observation_id":"057031ea-6220-4578-97f8-66f1dd18b5a3","resolution":{"observed_at":"2026-08-15T19:21:13.101287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.081894Z","title":"Building a computer mahjong player based on monte carlo simulation and opponent models","venue":null,"work_id":"72c78718-ff93-409e-987e-d4e9a080f177","year":2015},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.658813Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:d116d46a383bd1168c85c906b29a2e01f33d941cde88e46e3b663ab214336bb2","observation_id":"d79b351d-50d2-44cd-9adc-6de5f26056b5","resolution":{"observed_at":"2026-08-15T19:21:13.086791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10089","last_updated":"2018-02-25T07:48:19Z","snapshot_observed_at":"2026-08-14T20:28:40.030071Z","submitted_at":"2017-09-28T17:51:48Z","title":"Overcoming Exploration in Reinforcement Learning with Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10089","snapshot_observed_at":"2026-08-15T19:21:12.663108Z","title":"Overcoming exploration in reinforcement learning with demonstrations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.663108Z"},"links":{"cited_paper":"/paper/1709.10089","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:5024336bee85a33a3daba1d35587fa43b8260173585511acd01f8645d5b7ece3","observation_id":"557e7deb-6015-456f-a317-5f0ac27be47e","resolution":{"observed_at":"2026-08-15T19:21:12.663108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.067198Z","title":"Handbook on mahjong competition rules, 2016","venue":null,"work_id":"84c709e7-c3ef-4c09-92d1-5899bf9f7ed4","year":2016},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.667661Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:50aa3d78b5ffa4cf41dee6f4033d83301891a9b458d9bed039096df2a022228e","observation_id":"405fb5cf-c2c2-462c-b2d0-aecb0765c448","resolution":{"observed_at":"2026-08-15T19:21:13.071936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.052798Z","title":null,"venue":null,"work_id":"f91786ca-7521-45b4-86bb-5066c56cab8b","year":2018},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.671994Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:9e1510926979dc216bb6d2d0939ef3899970cde27fd67ac589961572b07d97ff","observation_id":"e96eacf4-8b1d-43e7-b269-6481250f5f57","resolution":{"observed_at":"2026-08-15T19:21:13.057541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-15T19:21:12.676241Z","title":"Jordan, and P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.676241Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:e80e19faa0bcc9df2990a783ceb327cae13f91377428936c65c4483f03274962","observation_id":"330d45d5-fc97-4d21-a156-e61ef9e9d8b9","resolution":{"observed_at":"2026-08-15T19:21:12.676241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:12.681331Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.681331Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:09a2bd0f607906821f868f7d7d77a4c6290b9abb0419d2cea8f93fef761cfcc5","observation_id":"fc122948-32cc-43f1-beac-ac578771c7de","resolution":{"observed_at":"2026-08-15T19:21:12.681331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T19:21:12.685791Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.685791Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:70c9e6ef721cba15f384fd401d106b1db35496b3fb1abe30ab6908b58705c896","observation_id":"59357414-e1ef-41d6-b9dd-8afa77bcaad9","resolution":{"observed_at":"2026-08-15T19:21:12.685791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-14T20:06:37.819179Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-15T19:21:12.690475Z","title":"Lillicrap, Karen Simonyan, and Demis Hassabis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.690475Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:963df1ea8a860e159e0b25f5c81c90cb780b734d1a9f5c32830e886991081fd5","observation_id":"efa39ccf-c4bd-4677-b3bb-215f03bc8770","resolution":{"observed_at":"2026-08-15T19:21:12.690475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-14T20:44:55.096659Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-15T19:21:12.694943Z","title":"Riedmiller","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.694943Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:afdf20c2be32c27f555b8ae0ee2174b19084081b4880060a73c6f7da3d6e546d","observation_id":"dcd816df-9cbd-4f93-b20c-ac64ed283c8a","resolution":{"observed_at":"2026-08-15T19:21:12.694943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.027396Z","title":"Czarnecki, Micha \\\"e l Mathieu, Andrew Dudzik, Junyoung Chung, David H","venue":null,"work_id":"88618c9e-a23d-4365-a1db-c02291e386d7","year":2019},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.699471Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:8b7311835105e622d3c767f272fb719a1d4c05a27bc7d43c3a48ceef5f181a94","observation_id":"3c7b3f68-6930-4007-bed4-bf885d102ae6","resolution":{"observed_at":"2026-08-15T19:21:13.032461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:13.012212Z","title":"Perfectdou: Dominating doudizhu with perfect information distillation, 2024","venue":null,"work_id":"ef0911c5-e19c-4f15-8e06-251f254fdc7a","year":2024},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.703785Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:a25f5137b3aee39ced77c1293cb74527b1c849ac3874f06a58f97b76424f2fd3","observation_id":"d1f718d7-9ee3-4d05-baca-b05b3d4cc908","resolution":{"observed_at":"2026-08-15T19:21:13.016806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.12692","last_updated":"2020-12-31T13:25:17Z","snapshot_observed_at":"2026-08-16T19:03:22.164717Z","submitted_at":"2020-11-25T12:52:33Z","title":"Towards Playing Full MOBA Games with Deep Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2011.12692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.12692","snapshot_observed_at":"2026-08-15T19:21:12.790341Z","title":"Towards Playing Full MOBA Games with Deep Reinforcement Learning","venue":"cs.AI","work_id":"da16438e-fe77-49d5-ad1e-8a1c3fc7f004","year":2020},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.708064Z"},"links":{"cited_paper":"/paper/2011.12692","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:9719e4d0eeb09d3f8dbf6ecd314d55017c08d6821186f6f00c2dbc4ed94348f5","observation_id":"173442c0-ff24-4094-8167-6d2242f30bb4","resolution":{"observed_at":"2026-08-15T19:21:12.795283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:12.997598Z","title":null,"venue":null,"work_id":"f0be0d2c-039d-4fd4-9bff-560edce63e27","year":2022},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.712541Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:0116061d528d17becbd3a9027d878144f04354e69a5b84a707fb4f77843a007a","observation_id":"302e7d29-979d-412d-a948-1fdda8081560","resolution":{"observed_at":"2026-08-15T19:21:13.002262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:12.983231Z","title":"Botzone: an online multi-agent competitive platform for ai education","venue":null,"work_id":"bf099106-6e21-439c-beaf-6a956cb4c28e","year":2018},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.717186Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:826aa6ffe556ab941b64946e572d94758efb652ef42b11c6a7982b37a4aaec84","observation_id":"07e4e0b7-95b3-48af-a75a-5d9e1405fd81","resolution":{"observed_at":"2026-08-15T19:21:12.987785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00530","last_updated":"2020-04-01T15:57:15Z","snapshot_observed_at":"2026-07-31T03:31:28.405982Z","submitted_at":"2020-04-01T15:57:15Z","title":"Learning Sparse Rewarded Tasks from Sub-Optimal Demonstrations","version":1},"cited_work":{"arxiv_id":"2004.00530","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.00530","snapshot_observed_at":"2026-08-15T19:21:12.767353Z","title":"Learning Sparse Rewarded Tasks from Sub-Optimal Demonstrations","venue":"cs.LG","work_id":"5c7d1669-58cc-403c-9594-79158e42862c","year":2020},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.721639Z"},"links":{"cited_paper":"/paper/2004.00530","citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:ce6f10cec54972d88d8fda6c739142e9ce05776b5e334816779be1980648b951","observation_id":"4c7b16fc-609f-494f-a652-43c6948cbd90","resolution":{"observed_at":"2026-08-15T19:21:12.774626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:12.968403Z","title":"Behavior proximal policy optimization, 2023","venue":null,"work_id":"c7b2a095-ac8d-4a6e-850e-57d736d192ba","year":2023},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.726434Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:76cd2e51f735c6560190bbe67720aab7d86fc4388487b349765ca85a86e31603","observation_id":"c2d288bc-147d-4240-a106-970f8d88c848","resolution":{"observed_at":"2026-08-15T19:21:12.973565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:21:12.730681Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T19:21:12.730681Z"},"links":{"citing_paper":"/paper/2506.16995"},"observation_digest":"sha256:65015cb87b8844eac309cfccb6d0e235657d9cd035c56e5eb52180213657af59","observation_id":"affdf193-c327-4a13-a16a-86b1a70ef7f4","resolution":{"observed_at":"2026-08-15T19:21:12.730681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16995","last_updated":"2026-07-06T09:11:16Z","latest_version":4,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T14:42:58.457326Z","submitted_at":"2025-06-20T13:46:06Z","title":"Policy Improvement with Style-Specific Demonstrations"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2506.16995."}