{"as_of":"2026-08-18T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66d5dbe6ee00be505c8033fe3e9c9f36de33bf5cbc497694c83670a97e61cb89","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:37:46.402936Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:27:43.858412Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T05:12:05.250025Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":"2506.07505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perry Dong, Alec M Lessing, Annie S Chen, and Chelsea Finn","venue":null,"work_id":"4822f2da-a743-4921-b5e6-96611e768822","year":2025},"citing_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-08T11:51:09.954364Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T05:09:02.111308Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2507.07986"},"observation_digest":"sha256:c340e6e55653439a25263a53b43967e3e257b271a4dcddea3425c433f19eaa13","observation_id":"f7f7acb0-042e-4fab-b930-ab01711ff06d","resolution":{"observed_at":"2026-05-19T05:12:05.252079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-08-04T11:01:27.929388Z","title":"Lessing, Annie S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-13T08:41:40.704344Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:27.929388Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:4aa9c7a4e3b3f3f1413154ed06408bcd0b6b78eee13840f4fe07a1e273314afd","observation_id":"912f030f-4650-4d47-b137-548db7d98738","resolution":{"observed_at":"2026-08-04T11:01:27.929388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":"2506.07505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perry Dong, Alec M Lessing, Annie S Chen, and Chelsea Finn","venue":null,"work_id":"4822f2da-a743-4921-b5e6-96611e768822","year":2025},"citing_paper":{"arxiv_id":"2603.13842","last_updated":"2026-04-10T02:57:29Z","snapshot_observed_at":"2026-08-02T22:21:29.644302Z","submitted_at":"2026-03-14T08:53:47Z","title":"Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T11:56:40.836234Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2603.13842"},"observation_digest":"sha256:61271132243ac435c3a07f189d42a5c395360aec267a21fc2f4c20ddd2471782","observation_id":"73bb73d3-8468-4d6c-b222-9bd2e736b647","resolution":{"observed_at":"2026-05-15T11:59:59.505114Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":"2506.07505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perry Dong, Alec M Lessing, Annie S Chen, and Chelsea Finn","venue":null,"work_id":"4822f2da-a743-4921-b5e6-96611e768822","year":2025},"citing_paper":{"arxiv_id":"2604.07945","last_updated":"2026-06-24T02:54:08Z","snapshot_observed_at":"2026-08-15T14:28:59.566067Z","submitted_at":"2026-04-09T08:08:37Z","title":"Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T17:48:36.372298Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2604.07945"},"observation_digest":"sha256:15d4d7e10092a26e5992b038dc4499fa8f0c719b9cc0e850b3b9418d148549bb","observation_id":"740ec016-c10b-4d8c-b869-42282c0b9244","resolution":{"observed_at":"2026-05-11T06:05:57.992073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-07-13T00:08:53.253285Z","title":"Lessing, Annie S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.07945","last_updated":"2026-06-24T02:54:08Z","snapshot_observed_at":"2026-08-15T14:28:59.566067Z","submitted_at":"2026-04-09T08:08:37Z","title":"Incremental Residual Reinforcement Learning Toward Real-World Learning for Social Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T00:08:53.253285Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2604.07945"},"observation_digest":"sha256:981983e6d0003aea606026c05edc0055aa98f256c647db4b972942bc7e3d43f3","observation_id":"510bd843-417c-4782-93d9-602cb0adf3fb","resolution":{"observed_at":"2026-07-13T00:08:53.253285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":"2506.07505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perry Dong, Alec M Lessing, Annie S Chen, and Chelsea Finn","venue":null,"work_id":"4822f2da-a743-4921-b5e6-96611e768822","year":2025},"citing_paper":{"arxiv_id":"2604.19730","last_updated":"2026-04-21T17:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T17:52:17Z","title":"FASTER: Value-Guided Sampling for Fast RL","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T02:47:36.475845Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2604.19730"},"observation_digest":"sha256:d6839330df00d0216f957df9a88648be255c817396b9acb71f0ccc1bfdd14375","observation_id":"2eee268b-bfe8-4404-b5b0-805b788a900a","resolution":{"observed_at":"2026-05-10T02:48:27.234174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-07-30T11:06:22.032376Z","title":"Lessing, Annie S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-17T11:13:47.265901Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-30T11:06:22.032376Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:c5b0b9224eea8a01e12c9d3663bdbe67214a82cc241c0db9e1cdd0f36f4fca0e","observation_id":"6dc67857-44d7-4bbf-85f2-b9e352933bc6","resolution":{"observed_at":"2026-07-30T11:06:22.032376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-08-05T04:27:43.858412Z","title":"Lessing, Annie S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-17T11:13:47.265901Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.858412Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:dd7b74c78ef3211917891317da48803afe8982c2aba426905f00ea3219b5e16b","observation_id":"49b28c9e-8205-4ea0-b167-2c60e716a353","resolution":{"observed_at":"2026-08-05T04:27:43.858412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07505/citation-record","integrity":"/paper/2506.07505/integrity","json":"/paper/2506.07505/citation-record.json","paper":"/paper/2506.07505"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.02948","last_updated":"2023-05-31T10:52:56Z","snapshot_observed_at":"2026-08-17T03:27:54.151065Z","submitted_at":"2023-02-06T17:30:22Z","title":"Efficient Online Reinforcement Learning with Offline Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02948","snapshot_observed_at":"2026-08-07T05:37:46.315134Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.315134Z"},"links":{"cited_paper":"/paper/2302.02948","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:4dffb1182031f154ed2c65955dcf1fa9385fa050c9cc9a9b5f703e25a399f501","observation_id":"54098eb7-f739-4b53-b9d7-90eaa0d274cc","resolution":{"observed_at":"2026-08-07T05:37:46.315134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:46.647556Z","title":"epochs per update","venue":null,"work_id":"417a4ff3-9c05-46d3-914b-a2559fd36725","year":2023},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.399321Z"},"links":{"citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:840f7d9a40cdb449e05325096a5399bba3e16b06de50aecb39090839fb4f92e1","observation_id":"c0c7ca42-7fe9-4e31-b0ba-49f239dff920","resolution":{"observed_at":"2026-08-07T05:37:46.651015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:46.636320Z","title":"worse\", which are successful demonstrations collected by inexperienced operators to incorporate additional diversity. Note that even though it is labeled","venue":null,"work_id":"0ae13500-2613-487f-a458-121c0d601167","year":2000},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.402936Z"},"links":{"citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:9589a2da0f574627e30bbd1454e9c1d5aa300ecdbae5557b9574a78d93e9bedc","observation_id":"fe3a2452-6743-4417-a163-f222b9a72661","resolution":{"observed_at":"2026-08-07T05:37:46.640381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-17T03:52:51.850185Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-07T05:37:46.332349Z","title":"Imitation bootstrapped reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.332349Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:18f9c7b9e23028cc1620556ed224a22fd50e2e4708b44c175723e20588d0e813","observation_id":"532c19c2-6b0f-4037-997e-8780c6c955fc","resolution":{"observed_at":"2026-08-07T05:37:46.332349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T05:37:46.336559Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.336559Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:2533e067ac0b06ee123d6d44f3ee40ceba1731c76516f6182529b780af3361d6","observation_id":"06c7343a-0aec-4818-8248-c1f59cbebcfd","resolution":{"observed_at":"2026-08-07T05:37:46.336559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08558","last_updated":"2023-10-12T17:50:09Z","snapshot_observed_at":"2026-08-16T14:52:35.290163Z","submitted_at":"2023-10-12T17:50:09Z","title":"Offline Retraining for Online RL: Decoupled Policy Learning to Mitigate Exploration Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08558","snapshot_observed_at":"2026-08-07T05:37:46.344696Z","title":"Offline retraining for online rl: Decoupled policy learning to mitigate exploration bias","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.344696Z"},"links":{"cited_paper":"/paper/2310.08558","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:c2ba740ada3f694e016186050776313058adc3b4058d9e1b31b55d1ff6bb6da7","observation_id":"b2329927-ac49-4b9c-b574-274bd0fd61ed","resolution":{"observed_at":"2026-08-07T05:37:46.344696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:46.669243Z","title":"Over- coming exploration in reinforcement learning with demonstrations","venue":null,"work_id":"8e13171d-ccec-4ccf-b1e4-93dbcf4e1bff","year":2018},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.349077Z"},"links":{"citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:65692d8984c5c52e07b400583407abb18f0841605521bae740d07561b161ff75","observation_id":"a13b6330-ea3a-4e6e-8793-87762ccd29da","resolution":{"observed_at":"2026-08-07T05:37:46.673242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10546","last_updated":"2018-06-18T10:29:41Z","snapshot_observed_at":"2026-08-16T11:20:51.351457Z","submitted_at":"2018-02-28T17:28:25Z","title":"Computational Theories of Curiosity-Driven Learning","version":2},"cited_work":{"arxiv_id":"1802.10546","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.10546","snapshot_observed_at":"2026-08-07T05:37:46.537054Z","title":"Computational Theories of Curiosity-Driven Learning","venue":"cs.AI","work_id":"7b75f335-af32-47db-a5b8-5086209a3f81","year":2018},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.356660Z"},"links":{"cited_paper":"/paper/1802.10546","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:f27f7f92fe082aa7e99e1e95583271211c7a40b3382f834252b27794542d6e68","observation_id":"2d76a449-f55e-45b6-9a25-4fe50f74881b","resolution":{"observed_at":"2026-08-07T05:37:46.541101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-08-15T17:49:11.636243Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-07T05:37:46.368469Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.368469Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:80ab4756c4d97ce7e7376c825724e5105572ddaf963a11cd356022e6f7e4124a","observation_id":"aeaa12dd-e2cd-41c4-8703-41c978fb7710","resolution":{"observed_at":"2026-08-07T05:37:46.368469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:46.658344Z","title":"Schmidhuber","venue":null,"work_id":"31a52349-f632-4f18-9c1c-224db8998fcc","year":1990},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.376056Z"},"links":{"citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:2b070f915d418e066308001a6724f9c304342bda584e6e39d07764916510fe82","observation_id":"8a60e0dd-1666-43bd-8c84-0e5cc8d313af","resolution":{"observed_at":"2026-08-07T05:37:46.661903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10024","last_updated":"2020-11-19T18:47:40Z","snapshot_observed_at":"2026-08-16T19:04:38.358475Z","submitted_at":"2020-11-19T18:47:40Z","title":"Parrot: Data-Driven Behavioral Priors for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.10024","snapshot_observed_at":"2026-08-07T05:37:46.379573Z","title":"Parrot: Data-driven behavioral priors for reinforcement learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.379573Z"},"links":{"cited_paper":"/paper/2011.10024","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:37b52463302c0c49e80cbb2136b13e932d368e8aed652a43961a8cfe2fc01355","observation_id":"13036d68-8079-4468-a573-ac508a627241","resolution":{"observed_at":"2026-08-07T05:37:46.379573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-16T16:24:37.265288Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-07T05:37:46.383535Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.383535Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:a666142c2a1fab6e8ab1d90bb7faefaa2f4b69a83cca46911c394f999ef04bdd","observation_id":"0b408ba0-19b1-410c-bd43-e0e121d4bbbf","resolution":{"observed_at":"2026-08-07T05:37:46.383535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-14T20:44:55.096659Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-07T05:37:46.387296Z","title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards.arXiv preprint arXiv:1707.08817,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.387296Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:9ec62571acaf23511cebcb78ab7b2c703a4efa52897111c8f1f87ba28d292ab7","observation_id":"4474229d-0083-4b59-87ee-9d01368b8b76","resolution":{"observed_at":"2026-08-07T05:37:46.387296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12621","last_updated":"2019-05-27T09:25:16Z","snapshot_observed_at":"2026-08-14T16:26:05.236166Z","submitted_at":"2019-05-27T09:25:16Z","title":"Learning latent state representation for speeding up exploration","version":1},"cited_work":{"arxiv_id":"1905.12621","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.12621","snapshot_observed_at":"2026-08-07T05:37:46.444474Z","title":"Learning latent state representation for speeding up exploration","venue":"cs.LG","work_id":"4ca53657-76f4-4690-ad30-cc8e11cf4340","year":2019},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.391312Z"},"links":{"cited_paper":"/paper/1905.12621","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:016d2f56d49fe46fc842d0d68cc12c8d350a2be60822f2ce834e38ea69b4b6fe","observation_id":"0066d2d0-370f-462f-b277-9688d2779557","resolution":{"observed_at":"2026-08-07T05:37:46.450428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00935","last_updated":"2025-08-28T20:06:01Z","snapshot_observed_at":"2026-08-16T15:58:17.733047Z","submitted_at":"2023-02-02T08:25:12Z","title":"Policy Expansion for Bridging Offline-to-Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00935","snapshot_observed_at":"2026-08-07T05:37:46.395221Z","title":"Policy expansion for bridging offline-to-online reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.395221Z"},"links":{"cited_paper":"/paper/2302.00935","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:4241c701f734fd6183672a083e8f2dd779ac1058b415e4a18af5ee91c5c6a064","observation_id":"5da8b341-7bea-4905-9769-d2ff68f8c0dd","resolution":{"observed_at":"2026-08-07T05:37:46.395221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-07T05:37:46.319807Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.319807Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:4f48115268985f354f81eab335a42600d999934bce2105381cfbd4a5e76df8dd","observation_id":"14ab7d25-fb58-442a-b0b2-d46ed3aa6d56","resolution":{"observed_at":"2026-08-07T05:37:46.319807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10567","last_updated":"2018-02-28T18:15:49Z","snapshot_observed_at":"2026-08-17T20:51:38.068007Z","submitted_at":"2018-02-28T18:15:49Z","title":"Learning by Playing - Solving Sparse Reward Tasks from Scratch","version":1},"cited_work":{"arxiv_id":"1802.10567","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.10567","snapshot_observed_at":"2026-08-07T05:37:46.491963Z","title":"Learning by Playing - Solving Sparse Reward Tasks from Scratch","venue":"cs.LG","work_id":"c742fa3c-4289-4e74-b043-c16b28b31447","year":2018},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.372311Z"},"links":{"cited_paper":"/paper/1802.10567","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:57a8b17c1cbcb5271911f5cdbc8ac0b681925d194caa173ed9fe686d64fab7eb","observation_id":"fd8c01a0-028f-4001-ae53-4883703f0cc9","resolution":{"observed_at":"2026-08-07T05:37:46.496733Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T05:37:46.352606Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.352606Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:99abd6408a2be788c89956d1b9117490700230deefcaffcdd98255714d4147d1","observation_id":"4197caaf-9d9d-41ea-b2dc-43b242038ebc","resolution":{"observed_at":"2026-08-07T05:37:46.352606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04161","last_updated":"2019-06-10T17:58:32Z","snapshot_observed_at":"2026-08-15T03:55:38.836685Z","submitted_at":"2019-06-10T17:58:32Z","title":"Self-Supervised Exploration via Disagreement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04161","snapshot_observed_at":"2026-08-07T05:37:46.364579Z","title":"Self-supervised exploration via disagreement","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.364579Z"},"links":{"cited_paper":"/paper/1906.04161","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:d18558cdcb60bddbc907e908e44f44b00765de5dfbca356d958b012cdba2fad8","observation_id":"084fe3ea-9951-45c1-9f97-44b59aa7afea","resolution":{"observed_at":"2026-08-07T05:37:46.364579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-08-14T17:23:27.494191Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-07T05:37:46.323819Z","title":"Go-explore: a new approach for hard-exploration problems","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.323819Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:bb49ba8d92d1996e8b055bb8ab9f318d5730203bbd18a029b58a00efcc6b12ca","observation_id":"18e26509-53b6-4ac0-a579-ec7add5f2be0","resolution":{"observed_at":"2026-08-07T05:37:46.323819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05274","last_updated":"2020-02-28T16:02:59Z","snapshot_observed_at":"2026-08-14T16:16:38.304748Z","submitted_at":"2019-06-12T17:57:02Z","title":"Efficient Exploration via State Marginal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05274","snapshot_observed_at":"2026-08-07T05:37:46.340669Z","title":"Efficient exploration via state marginal matching","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.340669Z"},"links":{"cited_paper":"/paper/1906.05274","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:2e7e1cb8a5b37e55ed689d910ba145101e55c29d00cae4584ee80a213fb38f10","observation_id":"59835236-da50-444b-87cb-09f63dc28f21","resolution":{"observed_at":"2026-08-07T05:37:46.340669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01387","last_updated":"2019-09-03T18:20:48Z","snapshot_observed_at":"2026-08-14T19:05:41.234386Z","submitted_at":"2019-09-03T18:20:48Z","title":"Making Efficient Use of Demonstrations to Solve Hard Exploration Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01387","snapshot_observed_at":"2026-08-07T05:37:46.360602Z","title":"Making efficient use of demonstrations to solve hard exploration problems","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.360602Z"},"links":{"cited_paper":"/paper/1909.01387","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:3ac8d3196f48b8d9422d9af980a6d4fad51f8c95f3fe0fcbcaa2a8f2200f4ffa","observation_id":"88953db2-4e1a-4aa0-8f4b-bd80c719fd01","resolution":{"observed_at":"2026-08-07T05:37:46.360602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05698","last_updated":"2022-12-12T04:28:50Z","snapshot_observed_at":"2026-08-16T16:09:24.282146Z","submitted_at":"2022-12-12T04:28:50Z","title":"MoDem: Accelerating Visual Model-Based Reinforcement Learning with Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05698","snapshot_observed_at":"2026-08-07T05:37:46.328115Z","title":"Modem: Accelerating visual model-based reinforcement learning with demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.328115Z"},"links":{"cited_paper":"/paper/2212.05698","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:75eb64b1647f885bb7271a51e85f71c9c4c6884389ee74293519b701b273e814","observation_id":"88e13b0c-c32f-4da1-9331-d149b31a9721","resolution":{"observed_at":"2026-08-07T05:37:46.328115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T17:02:43.942273Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":3,"verified_fuzzy":4},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 8 inbound Pith citation observations for arXiv:2506.07505."}