{"as_of":"2026-08-10T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e714b7146f63a5d150e7bfba887af4d9396d96d6a2d53c13594e9767cd55bca","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:39:58.748802Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.00288/citation-record","integrity":"/paper/2502.00288/integrity","json":"/paper/2502.00288/citation-record.json","paper":"/paper/2502.00288"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-09T19:39:58.569489Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.569489Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:ad74490f63d92d4833b542f63c2179f4e5856689f05e6e2967d544f2e2984a18","observation_id":"91374a6e-fc4f-4e94-bfff-27c6b7243ffc","resolution":{"observed_at":"2026-08-09T19:39:58.569489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.970684Z","title":"J., Smith, L., Kostrikov, I., and Levine, S","venue":null,"work_id":"395910cd-6af1-40d5-83fb-0e6a93b8d1fa","year":2023},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.574141Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:80c8b41d94d2e7caadae1697d0fa40836ac600f1056e92ebc97a52522da8ab7b","observation_id":"ef8aae6c-ceae-4080-bf79-253b2d321ea1","resolution":{"observed_at":"2026-08-09T19:39:59.974310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-09T19:39:58.577776Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.577776Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:7b76f6c7b95a620ff585ad98b7750d9a6d72b9eee5f4780e6b18af089f246b9a","observation_id":"af8f9d16-85ec-47ec-8e05-7cc9d5413d18","resolution":{"observed_at":"2026-08-09T19:39:58.577776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.960031Z","title":"Offline rl without off-policy evaluation","venue":null,"work_id":"06a73abc-ce86-4609-8b30-f857d9a2e394","year":2021},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.582381Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:e429eeae144c9f2b6be77214a8c2f5bf11a72ae5f808554d39a20532a0b4be54","observation_id":"b2f8dd92-cde7-4946-9ec5-23b8f5711018","resolution":{"observed_at":"2026-08-09T19:39:59.963751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.586110Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.586110Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:836680b2513601c9e2416b9aa7896f0b7c085e20aed69927c4cfe728097e0fd6","observation_id":"a4fae73a-bb69-4f9e-a2e2-7d7a2fae07cf","resolution":{"observed_at":"2026-08-09T19:39:58.586110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.942319Z","title":"A., Salazar, G., Tran, H","venue":null,"work_id":"5727e185-39c5-4d25-ab1d-0b593449e938","year":2023},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.589949Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:e5021d37bcf740f6dcd98e1970db766006082ffaa48ec9e540d6f074dbcb5f66","observation_id":"0150fed3-b684-4b76-8ff9-00776e071b32","resolution":{"observed_at":"2026-08-09T19:39:59.945981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.931502Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":"030861d0-8dd8-4b79-8945-20f8d4e3339a","year":2021},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.593890Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:36d5fd2ba59ec75187bba35bdd6f6d42ee8accc3084a44f74c374af476e1c5bb","observation_id":"a4c28b55-7c16-4d0e-bbf5-c61969531f0d","resolution":{"observed_at":"2026-08-09T19:39:59.935274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.920407Z","title":"Rvs: What is essential for offline RL via supervised learning? In International Conference on Learning Representations, 2022","venue":null,"work_id":"766ab5e5-e8ff-4105-8f28-9693ca78abde","year":2022},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.597241Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:6cbddef7215c1451cf2de6fc6ed86dc3df80c5eac3c893ffeecf1cbdb5b2659a","observation_id":"b0d109ad-e96a-4b00-994e-d6727e0c5b54","resolution":{"observed_at":"2026-08-09T19:39:59.924194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.600622Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.600622Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:b3dc6ceb0771cbb6a8ed441779191405e60a64cfcc7a54ecaa10de7c83ca166d","observation_id":"1fecd2b1-1114-40f1-a0e2-6ef574376969","resolution":{"observed_at":"2026-08-09T19:39:58.600622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-09T19:39:58.604186Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.604186Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:cf6f48ac7e40e043ba261e6d2db0fe331edf27645a3b58df0fcea15caf8cd159","observation_id":"db3b8a5c-55dd-40ad-a00f-948b388fe3ef","resolution":{"observed_at":"2026-08-09T19:39:58.604186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.909708Z","title":"and Gu, S","venue":null,"work_id":"d6d58517-97ee-4947-822c-e79486d67d0c","year":2021},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.608251Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:2fc060b779e8efd173f57a82eda966fb595901bf29b4689a34eed686fbaf09dc","observation_id":"7cf1abf2-b44b-437b-90f8-0fe4bb516db4","resolution":{"observed_at":"2026-08-09T19:39:59.913496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.612097Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.612097Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:5074bc7b14df5d6e5a5358554aa35b8e42a9e6cd0a72b0390b20f7fb32f9665f","observation_id":"2e974eba-5512-4ef2-9190-856862d12ee9","resolution":{"observed_at":"2026-08-09T19:39:58.612097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.615756Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.615756Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:7ae39ea515f932db7723a050bc381a25921c5429ac1fe3b5eb1ededa8d308f99","observation_id":"26ad1416-bb4e-4828-8072-f452aba5f1ce","resolution":{"observed_at":"2026-08-09T19:39:58.615756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.619235Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.619235Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:c9c75173a93367693b3648f160c9b952a967c72467c128905373576f3451d29d","observation_id":"2e7cc4ae-b972-48a4-be71-8365288c2187","resolution":{"observed_at":"2026-08-09T19:39:58.619235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.878871Z","title":"Modem: Accelerating visual model-based reinforcement learning with demonstrations","venue":null,"work_id":"1d87c83c-35a2-4844-827f-e735dc972c24","year":2023},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.622632Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:36d8f15364c08e1870c41fc099dbc8c9f8fd1c143173025f49dc8daa8925df3c","observation_id":"762c91c2-2744-4237-b726-5ae2ce80c82c","resolution":{"observed_at":"2026-08-09T19:39:59.882950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.867918Z","title":"Neural networks: a comprehensive foundation","venue":null,"work_id":"156fc6ca-8dfd-4b98-96db-6d8a3f615c07","year":1998},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.626098Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:cc840bc17ede1a9f723149c082b705c1800b91513780a80316f485941edbfd1d","observation_id":"bd92b01e-1c3a-4daf-b9b1-0e7201050ce0","resolution":{"observed_at":"2026-08-09T19:39:59.871795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-09T19:39:58.629593Z","title":"and Gimpel, K","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.629593Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:874185fcfa05a3f2bebafb63e840cf33db99a7ab23f118a79d925106c52484b9","observation_id":"12eb4e6e-2e22-44b3-ad2c-b7be9411f06e","resolution":{"observed_at":"2026-08-09T19:39:58.629593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.633495Z","title":"Deep q-learning from demonstrations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.633495Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:5cb2603a40db51620f991a798e054f87adb7c5c0390039d4cf94f87c429c8a55","observation_id":"7a2b416e-2a8f-4220-b613-e2dec9408142","resolution":{"observed_at":"2026-08-09T19:39:58.633495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.856506Z","title":"B ayesian design principles for offline-to-online reinforcement learning","venue":null,"work_id":"226fe91b-6b75-4f87-b0db-2b2243dd2629","year":2024},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.637064Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:fee6d7811c3c9dfeb854f1431f738d7831084c870bebfa75442de56790bac922","observation_id":"6c80aa3c-ffd2-4295-be7a-5301295dc6a5","resolution":{"observed_at":"2026-08-09T19:39:59.860365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.586484Z","title":"R., and Davison, A","venue":null,"work_id":"440834f6-f279-4ff2-a0cf-eccbb9d04811","year":2020},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.642052Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:2ce866059e839d391addd85d37cbd18d459c8219664d3fce390e31a0315e4e9d","observation_id":"493f95b0-9b97-4569-bfea-0995ca08aa92","resolution":{"observed_at":"2026-08-09T19:39:59.593966Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.645779Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.645779Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:c17a23f8d83c01d5ed785b461d13c34d9bfc1363ceba853fb575d501e44afcbf","observation_id":"b47e30cf-10fb-42c2-b51d-1a33e754ab05","resolution":{"observed_at":"2026-08-09T19:39:58.645779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.649212Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.649212Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:4cfd87751ccd817457422eb1667cbac30553d0d2d2eabd5b3ef506e9bf16abe9","observation_id":"ccf644af-9f28-4a5f-b182-1954113cb865","resolution":{"observed_at":"2026-08-09T19:39:58.649212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.833560Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble","venue":null,"work_id":"7ecb8626-ab2e-442d-b1b0-9b45758c2d43","year":2022},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.652437Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:8a84f1b9cc35359b70d15ee922071b999338329b6faeb0270d55ef8be6764929","observation_id":"538adca6-c19f-489d-9158-65b072b067f2","resolution":{"observed_at":"2026-08-09T19:39:59.837241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.823019Z","title":"Uni-o4: Unifying online and offline deep reinforcement learning with multi-step on-policy optimization","venue":null,"work_id":"f1bb2131-b66d-4614-8434-87e68a8f4b30","year":2024},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.655705Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:9d00eb9f21329c3cfcfb6ca2f81677ef28f5b73353d1760a102b05c5f1e4badb","observation_id":"aaf53e1a-99d2-490a-aa35-c56a737c90fb","resolution":{"observed_at":"2026-08-09T19:39:59.826694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.407764Z","title":"A survey of convolutional neural networks: Analysis, applications, and prospects","venue":null,"work_id":"163a71c4-9d1a-4e89-80d2-e53ad5ad6b9a","year":2022},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.658938Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:676dfcddafeeedee2e9b013253ef74d1e9a3e8630e8fc25877230bdb6499ea6e","observation_id":"aaf30073-6ddb-40f9-9145-f0178adef183","resolution":{"observed_at":"2026-08-09T19:39:59.411897Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-09T19:39:58.662257Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.662257Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:ad9c647efe678dd1a86023413d6b091c10ff8a847566534c735fcee4d3d34a45","observation_id":"e884384c-00bc-4e93-aeb3-71aef5333199","resolution":{"observed_at":"2026-08-09T19:39:58.662257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.05035","last_updated":"2019-06-08T00:56:16Z","snapshot_observed_at":"2026-08-09T14:30:10.563113Z","submitted_at":"2017-05-14T22:53:13Z","title":"Discrete Sequential Prediction of Continuous Actions for Deep RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.05035","snapshot_observed_at":"2026-08-09T19:39:58.665938Z","title":"Discrete sequential prediction of continuous actions for deep rl","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.665938Z"},"links":{"cited_paper":"/paper/1705.05035","citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:9c02d5724de16ffcda2b444ef83ed9fd82840db6d0053302eedffe463c8f9e6b","observation_id":"824cb68b-7c81-4977-99f0-f85c9e5c024a","resolution":{"observed_at":"2026-08-09T19:39:58.665938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.669816Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.669816Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:17995ff24aff91eee14514dfbfe62222d754994b955834024ff6eeacfd28ba6c","observation_id":"d4425530-19bc-4373-a556-f48c66a2efe0","resolution":{"observed_at":"2026-08-09T19:39:58.669816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.172339Z","title":"Overcoming exploration in reinforcement learning with demonstrations","venue":null,"work_id":"03d40bbb-5742-42d7-9157-cd4def5c7241","year":2018},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.673153Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:f5ae8c23e666ce61c05d8187dadeb6a0ec184b6e087c237346ba4c2702f84730","observation_id":"02cadaba-4b3f-4c95-bc9b-b71a628de3d4","resolution":{"observed_at":"2026-08-09T19:39:59.176348Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.805518Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":"150b812b-d3ca-4283-ac17-af72d0c8aba0","year":2023},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.676302Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:a4e61adea43bcd9170f3e82d6e0e05595f944cacc1fc7b7088ab41f46dd34d55","observation_id":"f3d12f85-0098-4afe-b502-e03eb612d060","resolution":{"observed_at":"2026-08-09T19:39:59.809768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.794483Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations, 2018","venue":null,"work_id":"bc154c0b-56c8-4504-a6a3-6cb32252f2ac","year":2018},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.679741Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:b3a23219981065ae89ae9ba7758fed51fe2d064d52bdc814a335fb9dc84d8f31","observation_id":"52cea845-30ab-41f4-a614-e4c62b127473","resolution":{"observed_at":"2026-08-09T19:39:59.798314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.783689Z","title":null,"venue":null,"work_id":"49b0ce14-dfdb-468d-875f-a6930ade96e0","year":2021},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.682953Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:1c47b4e2fb590edf5ec19a0ee4a8d0589af955a029f9191df739ab2c39daed98","observation_id":"991c977d-4f6b-4758-b19a-9f829615dd29","resolution":{"observed_at":"2026-08-09T19:39:59.787378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.686288Z","title":"Mastering atari, go, chess and shogi by planning with a learned model","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.686288Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:f459897b6ca9ea6eb36e0a9090f32dd435024d0261d8856051b241ca352b4ed4","observation_id":"358af754-ac01-460a-8232-e75feb34d301","resolution":{"observed_at":"2026-08-09T19:39:58.686288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T19:39:58.689604Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.689604Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:b33070900c9dcdb78132d1b7b33ceed4051badce56b1501f6c5667d63a2e3d76","observation_id":"ceb203cc-861f-4e3c-80ee-a5fddc944378","resolution":{"observed_at":"2026-08-09T19:39:58.689604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.693154Z","title":"and Abbeel, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.693154Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:3a50b54c04b04e083d77d805595e1620e39520fc719b40047d41602cb9cd4512","observation_id":"b3b41d11-1f2b-412f-bcda-c5f7599ee9d2","resolution":{"observed_at":"2026-08-09T19:39:58.693154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.765440Z","title":"Continuous control with coarse-to-fine reinforcement learning","venue":null,"work_id":"30841ee3-ffdc-492a-b494-95244910835e","year":2024},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.696684Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:5e15db7bcc8ac08d0f8b0692644b62a0ed0cec1fd25a657167c58e2a3a9e9e4d","observation_id":"c10b52f3-7744-4a07-94d5-28a36404e590","resolution":{"observed_at":"2026-08-09T19:39:59.769503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.754265Z","title":"Solving continuous control via q-learning","venue":null,"work_id":"6448cd92-0687-431f-bbcb-43e6de6a4dfc","year":2023},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.700226Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:50e8b581fe99cff111a3f4b54ccd4e9a30623b8766c6fefa80d58e3b4f3e6d94","observation_id":"26766bd2-613b-4f3f-bc8a-b5711008786f","resolution":{"observed_at":"2026-08-09T19:39:59.758043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.743098Z","title":"Growing Q -networks: S olving continuous control tasks with adaptive control resolution","venue":null,"work_id":"9bb1550d-af3a-4c8a-b628-9b557992c40e","year":2024},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.703922Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:1e71994a645bd5f02168b29abf5ab1a93a7a47a9dc717525442e6e20ae6b0031","observation_id":"04f49af1-4824-4fed-b2dd-03e662db1c07","resolution":{"observed_at":"2026-08-09T19:39:59.746815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.707331Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.707331Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:85c9463feac047cb454757590f5803695817323a1bc6372a5d7275bf680bfcf4","observation_id":"d5ef7617-735e-416b-94eb-1fa96bc507a2","resolution":{"observed_at":"2026-08-09T19:39:58.707331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i04.6059","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"and Agrawal, S","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"004700d7-8a44-43b2-9271-9cbdd0e904bd","year":2020},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.710807Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:c005d60916bfdab9d2e898de3f28fb5ce95ea3cbd49af3680ea8641a499ac3c2","observation_id":"590cead1-f946-4069-816b-55fde7943841","resolution":{"observed_at":"2026-08-09T19:39:58.802667Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v32i1.11798","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Action branching architectures for deep reinforcement learning","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"fc899188-6204-4d3f-8bee-72dd4eb386ac","year":2018},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.714256Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:d9a35c51d910aeb7ad22e34c7309d41c77bee7674153484f594bf3428d5590d6","observation_id":"b2aca0e3-7fa3-4625-9fa3-72622036c302","resolution":{"observed_at":"2026-08-09T19:39:58.790610Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.726082Z","title":"Learning to represent action values as a hypergraph on the action vertices","venue":null,"work_id":"bb75ccec-a16a-4d68-8794-bc5e40cf4ed2","year":2021},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.717906Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:74ae19f8f50424d98abbcafa319ec6dbbf4cf37dd5aa06ca9adab74e9934130e","observation_id":"76bb7886-7220-4fcb-b150-e0503c4d87ab","resolution":{"observed_at":"2026-08-09T19:39:59.729926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.721491Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.721491Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:eaad0ed948720a451c590fbfd2abdf1384c0356bf592933c7d4d85d44d6fcc1b","observation_id":"c3230589-da4a-48a3-a5e1-f6b7a96708c4","resolution":{"observed_at":"2026-08-09T19:39:58.721491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.715611Z","title":"Discriminator-weighted offline imitation learning from suboptimal demonstrations","venue":null,"work_id":"ba17d91a-0d8b-4da2-8f97-dc8ac104f9f1","year":2022},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.725163Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:695e7992f630e25d69a4780d36170b208b3ffdc4bff4c4105e0ee157e3793485","observation_id":"909c3e06-0f3d-4fa0-a2cd-0c5d93d6deb8","resolution":{"observed_at":"2026-08-09T19:39:59.719141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.703958Z","title":"Hd-cnn: Hierarchical deep convolutional neural networks for large scale visual recognition","venue":null,"work_id":"6d9525d7-d24b-41cd-a8b8-f5b9612ec584","year":2015},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.728435Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:7116189c1c0e79a047ea0df8dc0cb771f30370c7c4eb905f7787bcbe1f419942","observation_id":"f2673bbe-0e28-409c-acef-3c4fb7a9d297","resolution":{"observed_at":"2026-08-09T19:39:59.708249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.692012Z","title":"Mastering visual continuous control: Improved data-augmented reinforcement learning","venue":null,"work_id":"183994f1-a9a0-4a6f-baa7-46cc0902ba38","year":2022},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.731948Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:16ea4102f2e15c6b9929a5517f9132a8cdec5d45f46fe57d8eaefe8a342c2055","observation_id":"b7835a39-4772-4a97-9a2c-832d712639db","resolution":{"observed_at":"2026-08-09T19:39:59.695917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.681232Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games","venue":null,"work_id":"2ecd21aa-8a1a-4d8f-b7ad-bdff4f377b13","year":2022},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.735090Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:79d322644a99cbe10a4bd70b76b04da6a3764ec65c3860e9ccc123f4fc850a2b","observation_id":"51b5b9c5-0637-44b1-8770-9a8c6aa53510","resolution":{"observed_at":"2026-08-09T19:39:59.684908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.671311Z","title":"Policy expansion for bridging offline-to-online reinforcement learning","venue":null,"work_id":"75610f2d-2da3-4e21-a6d0-a55cfd25826f","year":2023},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.738490Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:11feeb2e3889f9dcd54d828c26e5eff8272b92d60fa84d7acc0518b3f03a3751","observation_id":"0094e1ab-6b8c-48c7-92db-8cf0d2792c8b","resolution":{"observed_at":"2026-08-09T19:39:59.674731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.660606Z","title":"Z., Kumar, V., Levine, S., and Finn, C","venue":null,"work_id":"22c36ae5-2a18-40a7-bfb3-9bc69ca6b05c","year":2023},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.741871Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:6e11e053be9853b69b03831c85ba19d544e75df2db8d1887200a3304c7bc068a","observation_id":"87a41440-f206-42de-8260-e1bae4ec3c3c","resolution":{"observed_at":"2026-08-09T19:39:59.664137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:59.649960Z","title":"D., Maas, A., Bagnell, J","venue":null,"work_id":"1edadb10-8085-4775-a714-1f7981e506aa","year":2008},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.745240Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:f0c0557c825899adfa526e9a2eb3ca9661a07ad49f462e8f329a86126100b2bc","observation_id":"c7add5a0-d9ee-428d-8d03-a620df032e05","resolution":{"observed_at":"2026-08-09T19:39:59.653624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:39:58.748802Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T19:39:58.748802Z"},"links":{"citing_paper":"/paper/2502.00288"},"observation_digest":"sha256:43ef1fa34ac494ce7658ed5cd002f3007dc1fdb1c70ce9a76fdd97733d954bb1","observation_id":"4a2aa577-c749-4a7a-bd3d-e5e44f236f26","resolution":{"observed_at":"2026-08-09T19:39:58.748802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00288","last_updated":"2025-05-29T03:49:50Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:29:47.124303Z","submitted_at":"2025-02-01T03:04:53Z","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":5,"verified_fuzzy":24},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2502.00288."}