{"as_of":"2026-08-15T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:119200781d1a594f7e2a0a8cdae91fe2b5fe12041879defc2ef142b7234f218c","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:42:34.550668Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.01639/citation-record","integrity":"/paper/2506.01639/integrity","json":"/paper/2506.01639/citation-record.json","paper":"/paper/2506.01639"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.444604Z","title":"Deriving and improving cma-es with information geometric trust regions","venue":null,"work_id":"16f660fa-f130-4180-ad82-ed72df987fa7","year":2017},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.434436Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:04a5d13c3a3fdd67e159dbbb55c132fdbd07e1ebce911862b8c44a4528cd4e0e","observation_id":"037ab0cc-4bfe-4cb9-83c5-532dc0ba7cdc","resolution":{"observed_at":"2026-08-07T11:42:35.449301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.434273Z","title":"Maximum a posteriori policy optimisation","venue":null,"work_id":"3ab8a652-79ae-4fc3-95fd-f4200f98f3e4","year":2018},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.454596Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:39bcf75de9ed012d553c01ea10b41e424d9dcf2234c8145ca06040b99518c810","observation_id":"e99c98b3-4569-4f1f-8ab5-30ed82433c2b","resolution":{"observed_at":"2026-08-07T11:42:35.438011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-08-14T19:03:44.264477Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-08-07T11:42:33.475700Z","title":"Maximum a posteriori policy optimisation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.475700Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:923b8b5e5b70ff5e7481c3f54d23115936d450fea38848f379ca656505718547","observation_id":"edc3fbf0-fb53-47d0-ad32-f868c9c1eef6","resolution":{"observed_at":"2026-08-07T11:42:33.475700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.424312Z","title":"Improved soft actor-critic: Mixing prioritized off-policy samples with on-policy experiences","venue":null,"work_id":"d43dcdc4-3f1a-405e-94ea-6e7dad7c81df","year":2022},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.497612Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:563f5c9ebc1ee0c1fc66b0beab408524ea62f05f2f8c4a20db2e9e5a93964574","observation_id":"669f855a-fb1f-4345-8f34-9131c79842e1","resolution":{"observed_at":"2026-08-07T11:42:35.427993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.414999Z","title":"Sukhatme","venue":null,"work_id":"c199de95-5d54-468f-8d49-a90a6928407e","year":2024},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.519432Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:10aff305ca55c6f3b075680b4bcf7512d812a2f71edbc6b9362fee0d941e4923","observation_id":"998ab124-4c61-4dbe-9271-1092e56717df","resolution":{"observed_at":"2026-08-07T11:42:35.418179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.404003Z","title":"Box2d: A 2d physics engine for games","venue":null,"work_id":"38ccc803-7f4a-4695-9230-6ff1b447f1d6","year":2011},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.548555Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:ca8ad955004fd9565fa0472a3ae29aa08d318a6b57b027a0bfd837b21c014361","observation_id":"a76f75fc-75d7-4c36-86b2-3f2e8582a2bd","resolution":{"observed_at":"2026-08-07T11:42:35.408208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:33.569756Z","title":"Greedification operators for policy optimization: Investigating forward and reverse kl divergences","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.569756Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:6ea1efc1c6efb532792f54b9cb90b4d7507daee93c08a6838721fdb977356104","observation_id":"91e8e127-d4ff-421f-950a-dd767d09f0a5","resolution":{"observed_at":"2026-08-07T11:42:33.569756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.389252Z","title":"Using expectation-maximization for reinforcement learning","venue":null,"work_id":"681aabd2-5e35-4112-b46c-0ef90ef3a030","year":1997},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.606210Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:d7341ef40cce788a44344738eb5f492e264e2af8df34996bf938decca4feda30","observation_id":"c3becc7a-769b-42c3-9abb-f51c1c418bb5","resolution":{"observed_at":"2026-08-07T11:42:35.392907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.379708Z","title":"Soft actor-critic for navigation of mobile robots","venue":null,"work_id":"f0967976-bfb4-4657-9852-233013ad198e","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.642675Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:bdc58b1b8ace34f3dfe4b6b7e9a53d9c9490aa91be79454e386c940400f499a1","observation_id":"a15b1794-9e53-4f58-a320-1a8848be737a","resolution":{"observed_at":"2026-08-07T11:42:35.383303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.371171Z","title":"Distributional soft actor-critic: Off-policy reinforcement learning for addressing value estimation errors","venue":null,"work_id":"9eed3ab7-a45d-4c74-8725-edbec1893819","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.671122Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:027d92d87700059d6b5fcecd51204dbf3675f47f8c5c8e4b93519d97479ebe8c","observation_id":"4c72111c-d7f2-4dc9-991f-b248de50cd2f","resolution":{"observed_at":"2026-08-07T11:42:35.374373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.361236Z","title":"Distributional soft actor-critic: Off-policy reinforcement learning for addressing value estimation errors","venue":null,"work_id":"3c5a1be1-a210-4ef2-b3e3-b1bb0d5d7d9f","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.692111Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:78208772680b0d016e169e90e90a2724a1ff402fe54b1d2238b1247df7e20386","observation_id":"9e1a854b-3c7a-4867-a536-e8a699640a70","resolution":{"observed_at":"2026-08-07T11:42:35.364809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.351593Z","title":"Virel: A variational inference framework for reinforcement learning","venue":null,"work_id":"cb0c2f97-def5-49a4-b30e-858a7a074e0e","year":2019},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.713449Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:55d1155fa4765013a9fedf00ffa2bb4f4ad959dbe45338fe14cf1aa9516f8332","observation_id":"a0d0cc48-fe5e-45cc-9910-719dcbb4657c","resolution":{"observed_at":"2026-08-07T11:42:35.355409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.342156Z","title":"Brax - a differentiable physics engine for large scale rigid body simulation","venue":null,"work_id":"ea24d268-08bd-43bd-a004-e4923c7377ba","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.734844Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:6493f6151e0b4ab8a1e94bdd9f58c7c0ccca6f5d39b48c41b81012d6045c3345","observation_id":"3032c6c8-423b-4b27-b522-9467f96829ad","resolution":{"observed_at":"2026-08-07T11:42:35.345980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.332038Z","title":"Iq-learn: Inverse soft-q learning for imitation","venue":null,"work_id":"3825c717-44fb-41a0-9ea5-5054fc8a9088","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.756905Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:195c351d58443ab3a7278d1dc3cd1a5b647519eb0686dd2d9db8f9f9c930793b","observation_id":"cfe213d7-5062-4740-bba8-ddca2d989ba3","resolution":{"observed_at":"2026-08-07T11:42:35.336235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.322787Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"efbe27cb-932d-4897-8ca2-4b817685139c","year":2017},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.779818Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:d72e1343702fafe4e52e55948d79c059c7d86988a947197b81df14d3f5579458","observation_id":"589bee85-2e5e-4e9a-9106-8d32a3887ca8","resolution":{"observed_at":"2026-08-07T11:42:35.326371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.313716Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"855ead6b-3f3a-40a9-b894-d68a8587ace3","year":2018},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.801739Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:0a191bc406f2513dc9ae347c70d63a9aadd2a56f3cf884168995ccfb87edf3d1","observation_id":"13f7922a-3653-4d92-8f01-029b477554f0","resolution":{"observed_at":"2026-08-07T11:42:35.317218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-07T11:42:33.823457Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.823457Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:dd778d251e044815862b47079c537dda8b2ddb3e592e9c2106b15369a73cb65b","observation_id":"09af56c0-619f-4464-b928-8b977479ce74","resolution":{"observed_at":"2026-08-07T11:42:33.823457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.303995Z","title":"The curse of dimensionality for numerical integration of smooth functions","venue":null,"work_id":"4a2661d8-de34-41e8-81b1-81faae390edf","year":2014},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.844042Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:3094a9ef9ac2d9bdf64638f07283ccd88083049a0110a45aaac5865b8feec209","observation_id":"07c4f6a2-5767-458f-b939-a5c2a23099d9","resolution":{"observed_at":"2026-08-07T11:42:35.307790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.294420Z","title":"Graph soft actor–critic reinforcement learning for large-scale distributed multirobot coordination","venue":null,"work_id":"1dc243e0-a076-4d07-9aa9-62de760aeeac","year":2025},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.874324Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:7bf084af3f7b9cc4f865d0cf58e6b8517ff264bf9b629abb072d0a4ebdf0b18d","observation_id":"6f661f2b-2f62-430a-b6b9-17b221abea52","resolution":{"observed_at":"2026-08-07T11:42:35.297605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.285394Z","title":"Cleanrl: High-quality single-file implementations of deep reinforcement learning algorithms","venue":null,"work_id":"b59b534b-10be-40fe-b154-6540c32808e9","year":2022},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.903554Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:706662f26fd99d5517bac3090191bffc631facd3ef1e0f4465ba3d710409e2c1","observation_id":"c1ada51c-5566-4cae-8b05-ee776a377e36","resolution":{"observed_at":"2026-08-07T11:42:35.288646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.274657Z","title":"Accelerating reinforcement learning with value-conditional state entropy exploration","venue":null,"work_id":"717459c8-72a5-4da5-9456-5ae559f996f9","year":2024},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.931033Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:5af69523a39307e3b1cfe00f6f4ee4c03746573fc97285d698cd848b8f597607","observation_id":"9ee33d03-f8d9-4270-a3e6-bdcd64224198","resolution":{"observed_at":"2026-08-07T11:42:35.278864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.264091Z","title":"Optimistic reinforcement learning by forward kullback--leibler divergence optimization","venue":null,"work_id":"ce0bb546-dc13-404d-8eba-0766824610fa","year":2022},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.952445Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:16295e415c3b1d8e9d106d56b8083f8c6b3644af8e3ab821a4065a7776f100d5","observation_id":"fff43b0d-d505-4b4c-bb31-b943f546a04b","resolution":{"observed_at":"2026-08-07T11:42:35.268488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.254302Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"853fab3e-291b-4b14-8c0c-1bfb42defaab","year":2020},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.973438Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:b85af60215142ba3a812b1f8cb5c39aa420ccdcd997e08f4f78c0d8116561eb7","observation_id":"f4940d73-37ee-4291-af6e-d085bf9bb700","resolution":{"observed_at":"2026-08-07T11:42:35.258046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T11:42:33.995064Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.995064Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:817b8c77c9afd84a8053eecadb9a009ad64915374e39d58afa400ab816f3c6ff","observation_id":"af218bc2-7795-4bd9-99b4-11c5e994d2ce","resolution":{"observed_at":"2026-08-07T11:42:33.995064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.244809Z","title":"Constrained variational policy optimization for safe reinforcement learning","venue":null,"work_id":"8e6160b3-0898-4319-87b0-2ed967534e10","year":2022},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.017398Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:50a5bc0bee095fcbbe79ad14b2ca77b2a852926ad23612b3ce50c3ce32400fbb","observation_id":"7a4ee0e9-c39c-4524-871a-32c1d5b62299","resolution":{"observed_at":"2026-08-07T11:42:35.248022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.235017Z","title":"Algorithm 145: Adaptive numerical integration by simpson's rule","venue":null,"work_id":"6dd5228d-09d7-46e5-aa85-16ede0deacd7","year":1962},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.042879Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:8cf4300af9026fb9c569d9425d26ced39cfa6d0ee69e0f65aa4013c7d3fab1a0","observation_id":"ef99ea56-bcce-4636-9b5a-a19d99e946b8","resolution":{"observed_at":"2026-08-07T11:42:35.238937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.223376Z","title":"On principled entropy exploration in policy optimization","venue":null,"work_id":"95f2c8bd-60b6-4030-94b6-673608bd6f30","year":2019},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.064724Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:f87a29ea546e737679a4d8db13ca16334016139a49ab9e088a2be4ed57cb9727","observation_id":"31cb562f-2668-4bdc-998a-82683a8e3736","resolution":{"observed_at":"2026-08-07T11:42:35.227828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.213524Z","title":"Importance sampling techniques for policy optimization","venue":null,"work_id":"dd19398e-c5e5-492a-aeae-33844b089898","year":2020},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.095121Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:dfb818a191307bd373d74527d14503b29dc341b028e47341c675840178b6096c","observation_id":"a4ce579e-74e0-4780-b0b3-f6b3ebf5c88f","resolution":{"observed_at":"2026-08-07T11:42:35.217571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.147276Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.147276Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:e195db2bf259ada16df73e63bcb7b58475e78990eec59a22f3d4ebaa1a03bf20","observation_id":"ebb7a7e3-ef59-4277-9405-574668b10395","resolution":{"observed_at":"2026-08-07T11:42:34.147276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.197433Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"b5bdf9fc-dab2-40ba-b18b-7df5cf8d115f","year":1928},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.170202Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:5d6882af975a79dc5e22e7bc27d13379d83a084a18aedb8551f7b83da18b29e6","observation_id":"9198cf18-ceb7-4813-9cd9-0f3804966b78","resolution":{"observed_at":"2026-08-07T11:42:35.201661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09321","last_updated":"2017-03-15T22:55:17Z","snapshot_observed_at":"2026-08-14T21:28:15.397417Z","submitted_at":"2016-11-28T20:15:55Z","title":"Improving Policy Gradient by Exploring Under-appreciated Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09321","snapshot_observed_at":"2026-08-07T11:42:34.196122Z","title":"Improving policy gradient by exploring under-appreciated rewards","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.196122Z"},"links":{"cited_paper":"/paper/1611.09321","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:38387235dfe224cb6a7c04eea376347d795b5b90a2d55b25ccf58af4ff8b4ee1","observation_id":"c4b94ee6-79d0-4931-8ac2-ba475ccf4576","resolution":{"observed_at":"2026-08-07T11:42:34.196122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.217785Z","title":"Stable-baselines3: Reliable reinforcement learning implementations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.217785Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:84102f1dba4de8749910f54bcf82102f752504961cc16b5f7dcfb244ed3293e2","observation_id":"c225e167-9421-4220-b4f7-27df15930022","resolution":{"observed_at":"2026-08-07T11:42:34.217785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.164002Z","title":"Trust region policy optimization","venue":null,"work_id":"fa2ecb10-41e0-4320-b820-e7a802b4f00e","year":2015},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.238985Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:022bd54703e2c40847cd4f54ff51308385ba00edec51b7511b61f16af315a835","observation_id":"69f38043-f28e-468a-a69e-d6efaccbcd41","resolution":{"observed_at":"2026-08-07T11:42:35.182420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:42:34.261078Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.261078Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:239ce6ec902c971e21f9f7483a6f8d0af3f6da08ff215f9bb7c048126db605df","observation_id":"a83300ff-a461-4fae-ab21-f7d0736b5e1d","resolution":{"observed_at":"2026-08-07T11:42:34.261078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.096009Z","title":"Monte carlo sampling methods","venue":null,"work_id":"0ff4e4ea-ff15-4961-a89c-ab9c211b0fda","year":2003},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.285541Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:9b4dff667de9b4aec60b12cee80c5130a1abb8da4ee2867b4e45cf38084062ed","observation_id":"1513d567-505b-47af-9015-2f7aca0c2c7d","resolution":{"observed_at":"2026-08-07T11:42:35.134269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.035156Z","title":"V-mpo: On-policy maximum a posteriori policy optimization for discrete and continuous control","venue":null,"work_id":"7cb3ba5c-43c9-4fd2-ad6a-da9b09472320","year":2020},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.312110Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:f824b45057df124ea058ea1b025fd2b8e095b2749a38a1c7f6bd97fbcc08d33e","observation_id":"10f56de9-2b04-4e8c-af7e-3c56428a2a02","resolution":{"observed_at":"2026-08-07T11:42:35.056253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-08-14T20:53:35.783079Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-07T11:42:34.333612Z","title":"Value-decomposition networks for cooperative multi-agent learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.333612Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:de4374c175067c716f126d6618e7526b5baf9a75e4a20b2362d676f2ead1cdfd","observation_id":"884cde22-32a5-463b-b479-c70cad6a28a7","resolution":{"observed_at":"2026-08-07T11:42:34.333612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.371554Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.371554Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:590f24b0f30bf2a271f1a2c6c23017325c8f95652b6c9e9546e954d67dc2a128","observation_id":"a0e0493e-d1ca-4cdc-96c2-5fbe9793ae0a","resolution":{"observed_at":"2026-08-07T11:42:34.371554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.393604Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.393604Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:d70be7f557efc7e89bedfe6a3585c6b2f9673243b4649df0b3b0c5806340ebe5","observation_id":"e1a785fa-c6f7-4a64-910c-c4b7f60424ba","resolution":{"observed_at":"2026-08-07T11:42:34.393604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.965635Z","title":"Probabilistic inference for solving discrete and continuous state markov decision processes","venue":null,"work_id":"32d481b2-8507-4dcf-8193-e3357214bd6c","year":2006},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.414592Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:07ac7f793a4f3da1be68d06ee1a1b824f7c7491eb721e2d921923c727086782f","observation_id":"4872ae71-a7d7-4117-b3db-df8724e4ae0b","resolution":{"observed_at":"2026-08-07T11:42:34.998747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.922255Z","title":"Self-play reinforcement learning guides protein engineering","venue":null,"work_id":"e0063880-521b-4436-b128-4153f3dfb0d2","year":2023},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.436726Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:562f1b50d55ad0a5f6d8655c00712b302d887b64350963be053d8745c01db6d7","observation_id":"e2e48a29-57ef-40ea-b092-25ed2df07db4","resolution":{"observed_at":"2026-08-07T11:42:34.939905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.869430Z","title":"Scalable trust-region method for deep reinforcement learning using kronecker-factored approximation","venue":null,"work_id":"48798fff-c3d2-4811-9671-e53a88065e46","year":2017},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.458763Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:97b610c56f855b1d67cbd8a6bf833e900fa78493519d6150b410f037990d9653","observation_id":"1b92f031-66b6-4596-a6af-efae17983045","resolution":{"observed_at":"2026-08-07T11:42:34.897254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.811037Z","title":"Monocular vision approach for soft actor-critic based car-following strategy in adaptive cruise control","venue":null,"work_id":"bd3d9f1d-1ee8-4af3-9c10-b5957d2c601d","year":2024},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.480133Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:f9201facf2b3ec21e69b153392e5548ee156ff93c2a7920283969466ca39ff9b","observation_id":"d012f224-7276-4e29-92e3-93359c316e22","resolution":{"observed_at":"2026-08-07T11:42:34.839762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.758395Z","title":"Wcsac: Worst-case soft actor critic for safety-constrained reinforcement learning","venue":null,"work_id":"4a9fefbc-e98a-40c7-906c-d905b7f5f729","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.501065Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:14828b3ca3d4ef87d73ca85dff141a2e73ee85190ab020d33b6a7800131d00df","observation_id":"1bdd5f55-a73a-40ce-a820-4a8fafe4d91e","resolution":{"observed_at":"2026-08-07T11:42:34.785426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.714909Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":"e8c53c1c-cc00-4271-8e3c-d735dfea47b8","year":2008},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.523235Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:840022e8d961c327a12f260c954db3aaf78eaceb5b223aa5cda5ff96faee742a","observation_id":"84d7064f-7693-4298-be96-8accd733b318","resolution":{"observed_at":"2026-08-07T11:42:34.731567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.670712Z","title":"Wasserstein gradient flows for optimizing gaussian mixture policies","venue":null,"work_id":"0c1ab005-075a-4f3f-81f5-aa1bf070110e","year":2024},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.550668Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:4a48194d6efd4d95376de27d9ad742c359c68bffbd40c773581671b9613e73c0","observation_id":"7cb4a608-aa9c-4c54-b024-3d59f93e49df","resolution":{"observed_at":"2026-08-07T11:42:34.688869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T09:32:52.217115Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2506.01639."}