{"as_of":"2026-08-10T07:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d11f4d7c8c903dac14cc3225349cadd4cf3d142e1d7ccc44f733dd34f564f48e","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:22:19.579220Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T14:02:11.084514Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T14:02:39.803656Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.05615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05615","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When maximum entropy misleads policy optimization","venue":null,"work_id":"2fc2b2b5-66d9-4d2b-9393-a6c80892f31f","year":2025},"citing_paper":{"arxiv_id":"2509.20265","last_updated":"2026-04-29T12:32:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T15:52:36Z","title":"Failure Modes of Maximum Entropy RLHF","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-18T14:02:11.084514Z"},"links":{"cited_paper":"/paper/2506.05615","citing_paper":"/paper/2509.20265"},"observation_digest":"sha256:fbd864ae35279a7a43845f2b05eade0135a643ee3c7d4a3246c8bd5a1c387207","observation_id":"0e5ebc49-9234-42de-9a5e-aea75042f0fd","resolution":{"observed_at":"2026-05-18T14:02:39.807781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.05615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05615","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When maximum entropy misleads policy optimization","venue":null,"work_id":"2fc2b2b5-66d9-4d2b-9393-a6c80892f31f","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2506.05615","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:afa0bea1d7dbe5d850d31c17809ebb1efddceb1c769177d878cd9b89bda4bc7e","observation_id":"f247a322-b1c6-4be2-9a99-b97a6a08b6c7","resolution":{"observed_at":"2026-05-13T01:42:02.858360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05615/citation-record","integrity":"/paper/2506.05615/integrity","json":"/paper/2506.05615/citation-record.json","paper":"/paper/2506.05615"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:16.719555Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:16.719555Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:b8dd60d83a830e8c19f33ace98295f2cf7b4fcc4593cf2efe5a9fef7f0333181","observation_id":"3cfdfe7b-2902-4bd2-861f-3790eca36b4a","resolution":{"observed_at":"2026-08-07T10:22:16.719555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-07-06T06:45:27.162265Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-08-07T10:22:16.780892Z","title":"T., Tassa, Y., Munos, R., Heess, N., and Riedmiller, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:16.780892Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:bce1164e52b8da70fc17b5fa9a4fee998376717fa3d7deda5a09cd63d74c2bb1","observation_id":"7ed8df2e-91d9-4fdd-9e25-d1b2a5a3d09c","resolution":{"observed_at":"2026-08-07T10:22:16.780892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.954416Z","title":"Spinning Up in Deep Reinforcement Learning","venue":null,"work_id":"ca83cfa5-9474-4624-b529-e1303936b7c0","year":2018},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:16.828271Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:2510882604c629409207da141cbb0b993a01a371d1c54eed7d6cba080cb87284","observation_id":"3ba359ac-d83a-4881-9cd8-a690560f82f0","resolution":{"observed_at":"2026-08-07T10:22:19.957240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.946193Z","title":"Understanding the impact of entropy on policy optimization","venue":null,"work_id":"dc762a21-a938-4b6d-ad05-4121462aaa08","year":2019},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:16.877406Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:e665546caa217c4bad75cf90026bad9c58f049e4f74f46f3b78fbf9593534924","observation_id":"3741c874-6a6b-4ba8-9a4e-6e830276842e","resolution":{"observed_at":"2026-08-07T10:22:19.949078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-09T23:24:21.399948Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T10:22:16.921856Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:16.921856Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:305dee57e531348d923899d9de67fdb14838fd8cb468feb5d443c0bccd5c8888","observation_id":"a1d20221-9ce0-42f5-b3f2-fa3e84d00c4b","resolution":{"observed_at":"2026-08-07T10:22:16.921856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13629","last_updated":"2024-10-26T19:35:57Z","snapshot_observed_at":"2026-08-09T22:32:18.296752Z","submitted_at":"2024-05-22T13:26:26Z","title":"Maximum Entropy Reinforcement Learning via Energy-Based Normalizing Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13629","snapshot_observed_at":"2026-08-07T10:22:16.992095Z","title":"Maximum entropy reinforcement learning via energy-based normalizing flow","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:16.992095Z"},"links":{"cited_paper":"/paper/2405.13629","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:96071d96b9aa1e57f31aaff98ca66e58e97fb3f2551c8a2e5d7811f932f4874b","observation_id":"fb85fd17-36b1-44e7-a447-845bd32a92e0","resolution":{"observed_at":"2026-08-07T10:22:16.992095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-08-07T10:22:17.058715Z","title":"and Levine, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.058715Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:22a7ac6bd4f67bc4c3c1d71bfff7e7ebf08f5c847bbf6f69f25d884686bf6464","observation_id":"11438e06-5740-4e59-8130-5d739374ddb3","resolution":{"observed_at":"2026-08-07T10:22:17.058715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.08562","last_updated":"2017-03-30T05:00:30Z","snapshot_observed_at":"2026-07-30T22:48:59.601842Z","submitted_at":"2015-12-28T23:59:12Z","title":"Taming the Noise in Reinforcement Learning via Soft Updates","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.08562","snapshot_observed_at":"2026-08-07T10:22:17.125983Z","title":"Taming the noise in reinforcement learning via soft updates","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.125983Z"},"links":{"cited_paper":"/paper/1512.08562","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:f5558a819700e2af7e52768ba50c9b259553619e65ca3fb31a13634fed1332fb","observation_id":"a47be5bd-5272-4dec-9b8b-66325e404ad1","resolution":{"observed_at":"2026-08-07T10:22:17.125983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:17.176212Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.176212Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:f69ed0a2906f61744f5ee13fe39e050bf273847e22b782ac3f5f37467243a7dc","observation_id":"fe085a38-ca6f-4a5f-b341-cc86366192f1","resolution":{"observed_at":"2026-08-07T10:22:17.176212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.934803Z","title":null,"venue":null,"work_id":"146d1dec-db15-4a09-a6c9-d21966cfb04b","year":2004},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.221044Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:307ff6105180dfb411bc8873525546275ce6501c4f4904da05ad477ee0f38505","observation_id":"322278c8-3405-43bf-90ee-650d5537e22e","resolution":{"observed_at":"2026-08-07T10:22:19.937401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.927544Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"03556720-5de4-4b89-b5df-626e148ac34d","year":2018},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.270932Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:12e4d56da962b3e148d26b6c5a88a341d26309cafc1fe2f56cde277c414c7d42","observation_id":"3bb7d50b-58e7-493c-9a8d-38f5ee45f565","resolution":{"observed_at":"2026-08-07T10:22:19.930355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-07T10:22:17.317512Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.317512Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:262d98936cee4b728cd4e82582898e6aa6e5e0ef766afb9d11108eea1543c6e5","observation_id":"1a730120-398b-41f2-bbec-73aa4db9edcf","resolution":{"observed_at":"2026-08-07T10:22:17.317512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.920079Z","title":"and Sung, Y","venue":null,"work_id":"e5c6435f-4967-4fa8-b150-bef3a93ad815","year":2021},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.388420Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:f29cc816912fcf00d6fd199139f57171cffbd66cd04d01ac514c3315c6b32d09","observation_id":"5b45be37-f084-425f-91d3-a958e5d58b15","resolution":{"observed_at":"2026-08-07T10:22:19.922589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.912141Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":"5ddfe43b-5b38-4d64-ba44-d4a8db14b81f","year":2019},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.464584Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:882185a2316760f7f223ba90914d8b522e93c1f1ebbb91f7f745bab69fa3d065","observation_id":"175fe72f-766e-4985-857e-00e466ee2af6","resolution":{"observed_at":"2026-08-07T10:22:19.914968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03046","last_updated":"2024-02-05T14:32:00Z","snapshot_observed_at":"2026-08-10T00:58:27.575137Z","submitted_at":"2024-02-05T14:32:00Z","title":"Open RL Benchmark: Comprehensive Tracked Experiments for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03046","snapshot_observed_at":"2026-08-07T10:22:17.490373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.490373Z"},"links":{"cited_paper":"/paper/2402.03046","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:b1147314766a1afa7bf2b866569dac077d989f4cb295eee55f3657a656219db8","observation_id":"8aa36212-437c-4431-b354-5576fe3f3a06","resolution":{"observed_at":"2026-08-07T10:22:17.490373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.904653Z","title":"Champion-level drone racing using deep reinforcement learning","venue":null,"work_id":"bf1ba4e7-85ff-40a0-a4eb-5449da2201d2","year":2023},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.593655Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:3f77cc95ffae6f1c9f81221ec1be01cbdb1dc01d5ac6411cb677982674bee9f3","observation_id":"a3d1cf22-6f06-4dbe-af98-8544da20c5b7","resolution":{"observed_at":"2026-08-07T10:22:19.907705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.896645Z","title":"and Sung, Y","venue":null,"work_id":"28c9344a-3506-4492-97cd-b2382ec17c88","year":2023},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.744302Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:8ad0d8f7d453762f8c885dccadfb8a13e47d01c2cfe320cd588ef1c33633b66b","observation_id":"9d7dd5da-192f-46b5-b584-f1b184b60e72","resolution":{"observed_at":"2026-08-07T10:22:19.900176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.887854Z","title":"Kinematic and dynamic vehicle models for autonomous driving control design","venue":null,"work_id":"0bed663e-d02c-4daf-bde9-9fe190c2f2a2","year":2015},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.831416Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:14c374fe03dc72e5c8ec4aad7c0a95ba96cd257028af7e967366052c8d54140b","observation_id":"1ffd29fb-afab-4ea1-88bb-8879ddb50c78","resolution":{"observed_at":"2026-08-07T10:22:19.892111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01016","last_updated":"2021-06-05T04:31:51Z","snapshot_observed_at":"2026-07-06T11:15:06.264738Z","submitted_at":"2021-06-02T08:30:14Z","title":"Deep Reinforcement Learning-based UAV Navigation and Control: A Soft Actor-Critic with Hindsight Experience Replay Approach","version":2},"cited_work":{"arxiv_id":"2106.01016","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.01016","snapshot_observed_at":"2026-08-07T10:22:19.679457Z","title":"Deep Reinforcement Learning-based UAV Navigation and Control: A Soft Actor-Critic with Hindsight Experience Replay Approach","venue":"eess.SY","work_id":"7d8d3aed-c0df-4adc-8c8e-2e0ed305c40f","year":2021},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:17.963354Z"},"links":{"cited_paper":"/paper/2106.01016","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:112396cdba8046fde75d39799a613dd54f9d5ae3fef668c686391056fc4a55b1","observation_id":"f5299dd2-2e7d-4417-b210-ba3f39bf8552","resolution":{"observed_at":"2026-08-07T10:22:19.684788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-07T10:22:18.076144Z","title":"Reinforcement learning and control as probabilistic inference: Tutorial and review","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:18.076144Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:c7b0c25acfdbea15da0b0c769f36da313aceded7c61e020bb75030c03d3de55e","observation_id":"7ff8de58-e602-4078-a42b-96ae3a2b2693","resolution":{"observed_at":"2026-08-07T10:22:18.076144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T10:22:18.196750Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:18.196750Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:04c524ab03b8b7563b201143aaa40ce0c9de0f4ff4462139b94f52976a242132","observation_id":"988004f9-72d7-40bb-a078-d82e59899b90","resolution":{"observed_at":"2026-08-07T10:22:18.196750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.880445Z","title":null,"venue":null,"work_id":"9b9040ae-9982-49ae-8776-b9387c407521","year":2020},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:18.282718Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:64cc07fc61cf8d57ebad50b387dc1e5f5c804be9bb40bc9f3d125d6a2a89dbb2","observation_id":"59eb3940-8023-4128-b456-7e2ccaae6eb6","resolution":{"observed_at":"2026-08-07T10:22:19.883223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.872600Z","title":"Learning robust perceptive locomotion for quadrupedal robots in the wild","venue":null,"work_id":"2f444c03-29e4-4969-bfbf-81bc67941cbf","year":2022},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:18.396483Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:2710c80dfded8ef6d45dde2f9cbfbdb576376892f04bc9b592a79aeb768e9e05","observation_id":"105d893a-77ec-4b90-b5f7-6b126d65be33","resolution":{"observed_at":"2026-08-07T10:22:19.875677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.865055Z","title":null,"venue":null,"work_id":"3ee73edb-d59d-499d-a052-89b3ca139cf6","year":2021},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:18.554171Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:d213d5618b23a15a15e391e855a24decd48d4eb0087a5169194969039ced5280","observation_id":"080d1d29-62bb-4843-934c-b26275bcb4b1","resolution":{"observed_at":"2026-08-07T10:22:19.867591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.855947Z","title":"G., D'Souza, J","venue":null,"work_id":"dfe339e9-3848-4232-bcae-829ceb6996f0","year":2024},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:18.668358Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:a18daa870c39491a96d96c5b570819b2273fb971e832a4199b3b96afcd8719d7","observation_id":"4daf9d6a-d930-4f42-ae69-d5839c53a0dd","resolution":{"observed_at":"2026-08-07T10:22:19.859215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01626","last_updated":"2017-04-07T15:20:05Z","snapshot_observed_at":"2026-08-10T05:17:24.691576Z","submitted_at":"2016-11-05T10:49:37Z","title":"Combining policy gradient and Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01626","snapshot_observed_at":"2026-08-07T10:22:18.826187Z","title":"Combining policy gradient and q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:18.826187Z"},"links":{"cited_paper":"/paper/1611.01626","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:0f4780616f3afe323d21f5e69f68da2cb81b0ca11be322f1abf1fb0d368a3346","observation_id":"7961c1ad-3399-4b34-90e3-82227103d096","resolution":{"observed_at":"2026-08-07T10:22:18.826187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.848648Z","title":"Opencat: Open-source quadruped robot","venue":null,"work_id":"669a4689-1e5b-4f0b-8590-0ea06f39a098","year":null},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:18.944410Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:518266a09d927385cb27b3560a3c64dff758f1d77cc51287126c05840ca0645a","observation_id":"e71550c9-1394-4f20-95e2-517adae6e27d","resolution":{"observed_at":"2026-08-07T10:22:19.851332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.840182Z","title":"O., Sedky, A","venue":null,"work_id":"22f6eaeb-cf58-44ea-a9e6-0a0db9c8fe2c","year":2021},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.048347Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:6a5ea1d88ac50cfea889b421d271296af1f91369d607c590cce75cec3d58c545","observation_id":"17d37bea-62c7-4ccb-8f91-74a0d65efd72","resolution":{"observed_at":"2026-08-07T10:22:19.843407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.831751Z","title":"Stable-baselines3: Reliable reinforcement learning implementations","venue":null,"work_id":"eafa3013-1254-424d-b92e-22e67170db11","year":2021},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.117262Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:da8062a829a6bcfe0bbbb05547d87a743e422b8c4fc1209f7fefc239dc190a64","observation_id":"5db18f27-50fa-4639-96c0-729c6decf565","resolution":{"observed_at":"2026-08-07T10:22:19.834678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.06032","last_updated":"2019-08-26T22:36:02Z","snapshot_observed_at":"2026-07-06T08:00:16.619191Z","submitted_at":"2019-06-14T05:46:10Z","title":"Adversarial Training Can Hurt Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.06032","snapshot_observed_at":"2026-08-07T10:22:19.229507Z","title":"M., Yang, F., Duchi, J","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.229507Z"},"links":{"cited_paper":"/paper/1906.06032","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:ec0c3f51b27dfe3abf8d78f68786f6f1fec4c860c3aab09399ce5c3d951502d0","observation_id":"c63c6d64-fe27-4f42-808b-06d2de7a3bb2","resolution":{"observed_at":"2026-08-07T10:22:19.229507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10716","last_updated":"2020-07-06T21:03:23Z","snapshot_observed_at":"2026-08-08T14:49:42.230855Z","submitted_at":"2020-02-25T08:03:01Z","title":"Understanding and Mitigating the Tradeoff Between Robustness and Accuracy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.10716","snapshot_observed_at":"2026-08-07T10:22:19.326777Z","title":"M., Yang, F., Duchi, J., and Liang, P","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.326777Z"},"links":{"cited_paper":"/paper/2002.10716","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:672b0b330cb3548935087d0e025d906f96ffa30072c70aa19bacfe6e088d02b2","observation_id":"8abdb24a-ff3c-4506-9c82-71e83782a5e8","resolution":{"observed_at":"2026-08-07T10:22:19.326777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.823400Z","title":"On stochastic optimal control and reinforcement learning by approximate inference","venue":null,"work_id":"1c9db603-f391-4197-8890-a960037321d2","year":2013},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.443620Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:debcc12771a5ad3f46e9dcffd7f4bbceea5110a6691000d3fca7e90ea6d337ac","observation_id":"ba0578b8-ff14-4e66-b2a1-6d8bd692b8c1","resolution":{"observed_at":"2026-08-07T10:22:19.826928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.815438Z","title":"A survey of path following control strategies for uavs focused on quadrotors","venue":null,"work_id":"249dd74d-8e9c-4aa6-8038-011b14302c9c","year":2020},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.533147Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:1136e0686010c75fbee67b52793c8fb55853e3bf3e031807a035fd66eb2c472c","observation_id":"91bf7a7a-c3b6-4bf9-86e6-ff230b67743c","resolution":{"observed_at":"2026-08-07T10:22:19.818218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-07T10:22:19.535372Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.535372Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:9e2236f689dabc05ca38499779949b925d761002dc1488399fafaf8179905b4a","observation_id":"a98d043c-5884-4544-9165-a23de4ab58f2","resolution":{"observed_at":"2026-08-07T10:22:19.535372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:22:19.537569Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.537569Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:1409d40a0b9c85ca23226c7dcf93f615eb6c079072dc2627bee82c0e7a504db0","observation_id":"68ca8698-a3ce-4e2d-a3de-af39c3fbb52f","resolution":{"observed_at":"2026-08-07T10:22:19.537569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.807976Z","title":"M., Vergara, P","venue":null,"work_id":"60b56d4f-d392-4bb4-a2eb-41f90211afdc","year":2022},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.541152Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:744aa3af1ec716edc50df6c6e63cfc4377f85f8c5365fa80043b90d778b6e63b","observation_id":"4759333a-bd67-41eb-9a2e-1ae8992324b4","resolution":{"observed_at":"2026-08-07T10:22:19.810564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.799812Z","title":null,"venue":null,"work_id":"ee4406b9-85b6-41b4-97e1-481135b52187","year":1995},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.543450Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:2ee174c6cced8fafd58134545e43af0171338b351689648b13f9062601621151","observation_id":"b1ee5d6a-f726-4b09-be7f-bb7e24cc38b9","resolution":{"observed_at":"2026-08-07T10:22:19.802698Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.790924Z","title":"Is robustness the cost of accuracy? – a comprehensive study on the robustness of 18 deep image classification models","venue":null,"work_id":"bb47e9a6-9ca8-4bd2-a90f-3c808a3cf1e0","year":2018},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.545689Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:4f79558483c3ad52cf9e8b0fd1fbc7060c6f82705cff8c38aea96cf540616aeb","observation_id":"e5f9703d-9a98-4688-ab6b-7cdd8c8ac3fb","resolution":{"observed_at":"2026-08-07T10:22:19.794990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.783031Z","title":"and Karak \\\"o se, M","venue":null,"work_id":"1581bd32-88a5-45cb-8344-4d7558cb28c1","year":2023},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.547605Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:76dab2965b3055ac6f895bc8e9d63a7b27be0627c5e932d24091f943dbb080a4","observation_id":"9f259164-14cb-49b4-a806-ad92c4130356","resolution":{"observed_at":"2026-08-07T10:22:19.785849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.549765Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.549765Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:6b051e572dab3a5af218bc2458a7a5f23b7c0d99e88f89388667eb3f3869c249","observation_id":"fec21014-f7c5-4cd7-8b51-d30639b59396","resolution":{"observed_at":"2026-08-07T10:22:19.549765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.770348Z","title":"Robot trajectory optimization using approximate inference","venue":null,"work_id":"bcd2c5c5-3906-4422-a288-3b4866039b4e","year":2009},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.552457Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:89394388f0a9b5f1eccd54d06b5e05133765f478c32e4923a4acf3bb7c596595","observation_id":"278d8bac-202a-4fff-950e-61e269332467","resolution":{"observed_at":"2026-08-07T10:22:19.773741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-07T10:22:19.555066Z","title":"U., De Cola, G., Deleu, T., Goul \\ a o, M., Kallinteris, A., Krimmel, M., KG, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.555066Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:6d6cebb5c8cbe10ca127222a4bdb6bf3c3aa632c962e674f77f223e97b227fae","observation_id":"fc58c466-bcb2-4fb0-bf7e-757093231711","resolution":{"observed_at":"2026-08-07T10:22:19.555066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12152","last_updated":"2019-09-09T08:09:25Z","snapshot_observed_at":"2026-08-08T14:51:08.356714Z","submitted_at":"2018-05-30T18:00:32Z","title":"Robustness May Be at Odds with Accuracy","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.12152","snapshot_observed_at":"2026-08-07T10:22:19.557477Z","title":"Robustness may be at odds with accuracy","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.557477Z"},"links":{"cited_paper":"/paper/1805.12152","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:289415e1073adfd2e8c607e34ac3f6ba97cae99fc6d0c4846aa812db01b3ac1c","observation_id":"446f0514-18ab-48ba-84cb-5b9db5ec58ec","resolution":{"observed_at":"2026-08-07T10:22:19.557477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01932","last_updated":"2020-07-31T04:34:20Z","snapshot_observed_at":"2026-08-08T19:47:14.464724Z","submitted_at":"2020-07-03T20:26:50Z","title":"Meta-SAC: Auto-tune the Entropy Temperature of Soft Actor-Critic via Metagradient","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01932","snapshot_observed_at":"2026-08-07T10:22:19.560314Z","title":"and Ni, T","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.560314Z"},"links":{"cited_paper":"/paper/2007.01932","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:b407ffabf2ef60895958e805e34c2d1206c0942d0ef9fd3abba24d61ef6398e0","observation_id":"2c78c91b-c85e-4c26-90a5-9721dbf43dd2","resolution":{"observed_at":"2026-08-07T10:22:19.560314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14171","last_updated":"2022-08-10T16:20:23Z","snapshot_observed_at":"2026-08-01T11:11:33.392958Z","submitted_at":"2021-07-29T16:49:03Z","title":"Tianshou: a Highly Modularized Deep Reinforcement Learning Library","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14171","snapshot_observed_at":"2026-08-07T10:22:19.562842Z","title":"Tianshou: A highly modularized deep reinforcement learning library","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.562842Z"},"links":{"cited_paper":"/paper/2107.14171","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:14a2c587b0559c27e9a8fd2725f21532eacd49e17c56be3978a3a10efeacb73d","observation_id":"f21f248e-f555-4e3d-a345-a0a431a0a37a","resolution":{"observed_at":"2026-08-07T10:22:19.562842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.762382Z","title":"Karting racing: A revisit to ppo and sac algorithm","venue":null,"work_id":"dac94c1b-b253-4ef7-9074-214fdb4b235c","year":2021},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.565395Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:fd7836a9818844badc5c73c8184e1c4ffe6b1619f6ad7bc19f0c0f4614e6656d","observation_id":"a40286e8-707f-43ee-a7bc-6c6d11661dc0","resolution":{"observed_at":"2026-08-07T10:22:19.765245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02460","last_updated":"2020-07-12T19:59:39Z","snapshot_observed_at":"2026-07-06T09:02:23.367026Z","submitted_at":"2020-03-05T07:09:32Z","title":"A Closer Look at Accuracy vs. Robustness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02460","snapshot_observed_at":"2026-08-07T10:22:19.567927Z","title":"A closer look at accuracy vs","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.567927Z"},"links":{"cited_paper":"/paper/2003.02460","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:03e623172a6dd1020035a932a9901473c90f5ebc333efe325924de38fc3f2fe7","observation_id":"bd862ccf-0fa6-4ba0-9a40-62e9f5ef98de","resolution":{"observed_at":"2026-08-07T10:22:19.567927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.754424Z","title":"Theoretically principled trade-off between robustness and accuracy","venue":null,"work_id":"b83ed46b-3895-4789-8311-a64bf808b361","year":2019},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.570121Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:14f7f01ba0cb66fb3c65aac3b363c8ab74e6ebb3198d36657f8ceee79edc78c4","observation_id":"dc757881-c934-4bf9-b07c-fa46c66f7b6f","resolution":{"observed_at":"2026-08-07T10:22:19.757149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10759","last_updated":"2024-09-26T11:13:10Z","snapshot_observed_at":"2026-08-08T00:03:50.512548Z","submitted_at":"2024-06-15T23:21:10Z","title":"Humanoid Parkour Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10759","snapshot_observed_at":"2026-08-07T10:22:19.572182Z","title":"Humanoid parkour learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.572182Z"},"links":{"cited_paper":"/paper/2406.10759","citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:174fd5fae33f8605ba8d729aec3174d393fa946fa532c31f0f59950633c6b313","observation_id":"376d0516-78de-43d3-a668-855b9b69e303","resolution":{"observed_at":"2026-08-07T10:22:19.572182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.574355Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.574355Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:eeef107c53283ec7a40ea03a3c1e57ccd588a4c16458deaa2dbc9b4d005c7225","observation_id":"d4fbaa72-699b-40c1-ade6-161f429e7168","resolution":{"observed_at":"2026-08-07T10:22:19.574355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.741689Z","title":"D., Maas, A","venue":null,"work_id":"8792686a-d443-43d7-8b96-a18ce1c557a4","year":2008},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.576834Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:141b66a0a7b30426199ee88c7167156b58d92e4e9594edbe2f88177765d3df33","observation_id":"501bdbb6-3a21-4c66-8c99-9df64c8a0f33","resolution":{"observed_at":"2026-08-07T10:22:19.745549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:19.733895Z","title":"D., Bagnell, D., and Dey, A","venue":null,"work_id":"bae3c1cb-3926-467c-87a6-6a2f36f1cec3","year":2010},"citing_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:19.579220Z"},"links":{"citing_paper":"/paper/2506.05615"},"observation_digest":"sha256:b52a844281e7ea155a972aacaed4ada8acd8d382ab3ab74fb7879d2597e74538","observation_id":"56f51a5b-be0c-4dca-992f-1a07088813b8","resolution":{"observed_at":"2026-08-07T10:22:19.736588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T14:53:23.575086Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 2 inbound Pith citation observations for arXiv:2506.05615."}