{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2019:QLO5OR6MEHTS2453YMJVY2O2ZG","short_pith_number":"pith:QLO5OR6M","canonical_record":{"source":{"id":"1909.03198","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-07T06:53:01Z","cross_cats_sorted":["cs.AI","stat.ML"],"title_canon_sha256":"87c0e6fee8552e5c04d5d2018a3a60b33df36b74233d32e38558119286299a93","abstract_canon_sha256":"c6f1e01a0e84efecee2c724d04b32abcc62338d8cb9a708b226488609a859e76"},"schema_version":"1.0"},"canonical_sha256":"82ddd747cc21e72d73bbc3135c69dac9bfa7e485f1732a53d9f8e6fa8ed143dd","source":{"kind":"arxiv","id":"1909.03198","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"1909.03198","created_at":"2026-07-05T00:03:03Z"},{"alias_kind":"arxiv_version","alias_value":"1909.03198v1","created_at":"2026-07-05T00:03:03Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1909.03198","created_at":"2026-07-05T00:03:03Z"},{"alias_kind":"pith_short_12","alias_value":"QLO5OR6MEHTS","created_at":"2026-07-05T00:03:03Z"},{"alias_kind":"pith_short_16","alias_value":"QLO5OR6MEHTS2453","created_at":"2026-07-05T00:03:03Z"},{"alias_kind":"pith_short_8","alias_value":"QLO5OR6M","created_at":"2026-07-05T00:03:03Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2019:QLO5OR6MEHTS2453YMJVY2O2ZG","target":"record","payload":{"canonical_record":{"source":{"id":"1909.03198","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-07T06:53:01Z","cross_cats_sorted":["cs.AI","stat.ML"],"title_canon_sha256":"87c0e6fee8552e5c04d5d2018a3a60b33df36b74233d32e38558119286299a93","abstract_canon_sha256":"c6f1e01a0e84efecee2c724d04b32abcc62338d8cb9a708b226488609a859e76"},"schema_version":"1.0"},"canonical_sha256":"82ddd747cc21e72d73bbc3135c69dac9bfa7e485f1732a53d9f8e6fa8ed143dd","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T00:03:03.373631Z","signature_b64":"Nqpbxb7ord+xNQh9dBfE+x7RU1eJALPOA9YwJPOhg7J8g5m/dQ8T6tf5iku2GVNfnJSqSeX0ctcisH5vbPALAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"82ddd747cc21e72d73bbc3135c69dac9bfa7e485f1732a53d9f8e6fa8ed143dd","last_reissued_at":"2026-07-05T00:03:03.373272Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T00:03:03.373272Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"1909.03198","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T00:03:03Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"edf2LRGWur7DJjO5pV23HNyq2Ryx1MTg6E5iHpFsD8t+3Gx8GcvvYJJJmJgG8ui+hDKcdnHL/hquYO8LwBH+DA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-16T04:33:35.662924Z"},"content_sha256":"fbbc40ef6cc29b752a321ee1d381d32c15eda92f6fa9dd05a1af2939223912c0","schema_version":"1.0","event_id":"sha256:fbbc40ef6cc29b752a321ee1d381d32c15eda92f6fa9dd05a1af2939223912c0"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2019:QLO5OR6MEHTS2453YMJVY2O2ZG","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Soft Policy Gradient Method for Maximum Entropy Deep Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","stat.ML"],"primary_cat":"cs.LG","authors_text":"Cheng Wu, Shiji Song, Wenjie Shi","submitted_at":"2019-09-07T06:53:01Z","abstract_excerpt":"Maximum entropy deep reinforcement learning (RL) methods have been demonstrated on a range of challenging continuous tasks. However, existing methods either suffer from severe instability when training on large off-policy data or cannot scale to tasks with very high state and action dimensionality such as 3D humanoid locomotion. Besides, the optimality of desired Boltzmann policy set for non-optimal soft value function is not persuasive enough. In this paper, we first derive soft policy gradient based on entropy regularized expected reward objective for RL with continuous actions. Then, we pre"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1909.03198","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/1909.03198/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T00:03:03Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"yWc8ueDvHwImJ+zYv3TBFKKsR6zPhMnH88oC5i0GV4dV3XmovBVz1qfr+1SwqRUqmfjs4J1+f/Ye16/lJqXDBA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-16T04:33:35.663422Z"},"content_sha256":"b0b93032e8564901ee8309e270f7aa8fe370acdca630701e94310588a472f75f","schema_version":"1.0","event_id":"sha256:b0b93032e8564901ee8309e270f7aa8fe370acdca630701e94310588a472f75f"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/QLO5OR6MEHTS2453YMJVY2O2ZG/bundle.json","state_url":"https://pith.science/pith/QLO5OR6MEHTS2453YMJVY2O2ZG/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/QLO5OR6MEHTS2453YMJVY2O2ZG/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-16T04:33:35Z","links":{"resolver":"https://pith.science/pith/QLO5OR6MEHTS2453YMJVY2O2ZG","bundle":"https://pith.science/pith/QLO5OR6MEHTS2453YMJVY2O2ZG/bundle.json","state":"https://pith.science/pith/QLO5OR6MEHTS2453YMJVY2O2ZG/state.json","well_known_bundle":"https://pith.science/.well-known/pith/QLO5OR6MEHTS2453YMJVY2O2ZG/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2019:QLO5OR6MEHTS2453YMJVY2O2ZG","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"c6f1e01a0e84efecee2c724d04b32abcc62338d8cb9a708b226488609a859e76","cross_cats_sorted":["cs.AI","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-07T06:53:01Z","title_canon_sha256":"87c0e6fee8552e5c04d5d2018a3a60b33df36b74233d32e38558119286299a93"},"schema_version":"1.0","source":{"id":"1909.03198","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"1909.03198","created_at":"2026-07-05T00:03:03Z"},{"alias_kind":"arxiv_version","alias_value":"1909.03198v1","created_at":"2026-07-05T00:03:03Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1909.03198","created_at":"2026-07-05T00:03:03Z"},{"alias_kind":"pith_short_12","alias_value":"QLO5OR6MEHTS","created_at":"2026-07-05T00:03:03Z"},{"alias_kind":"pith_short_16","alias_value":"QLO5OR6MEHTS2453","created_at":"2026-07-05T00:03:03Z"},{"alias_kind":"pith_short_8","alias_value":"QLO5OR6M","created_at":"2026-07-05T00:03:03Z"}],"graph_snapshots":[{"event_id":"sha256:b0b93032e8564901ee8309e270f7aa8fe370acdca630701e94310588a472f75f","target":"graph","created_at":"2026-07-05T00:03:03Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/1909.03198/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Maximum entropy deep reinforcement learning (RL) methods have been demonstrated on a range of challenging continuous tasks. However, existing methods either suffer from severe instability when training on large off-policy data or cannot scale to tasks with very high state and action dimensionality such as 3D humanoid locomotion. Besides, the optimality of desired Boltzmann policy set for non-optimal soft value function is not persuasive enough. In this paper, we first derive soft policy gradient based on entropy regularized expected reward objective for RL with continuous actions. Then, we pre","authors_text":"Cheng Wu, Shiji Song, Wenjie Shi","cross_cats":["cs.AI","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-07T06:53:01Z","title":"Soft Policy Gradient Method for Maximum Entropy Deep Reinforcement Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1909.03198","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:fbbc40ef6cc29b752a321ee1d381d32c15eda92f6fa9dd05a1af2939223912c0","target":"record","created_at":"2026-07-05T00:03:03Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"c6f1e01a0e84efecee2c724d04b32abcc62338d8cb9a708b226488609a859e76","cross_cats_sorted":["cs.AI","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-07T06:53:01Z","title_canon_sha256":"87c0e6fee8552e5c04d5d2018a3a60b33df36b74233d32e38558119286299a93"},"schema_version":"1.0","source":{"id":"1909.03198","kind":"arxiv","version":1}},"canonical_sha256":"82ddd747cc21e72d73bbc3135c69dac9bfa7e485f1732a53d9f8e6fa8ed143dd","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"82ddd747cc21e72d73bbc3135c69dac9bfa7e485f1732a53d9f8e6fa8ed143dd","first_computed_at":"2026-07-05T00:03:03.373272Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T00:03:03.373272Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"Nqpbxb7ord+xNQh9dBfE+x7RU1eJALPOA9YwJPOhg7J8g5m/dQ8T6tf5iku2GVNfnJSqSeX0ctcisH5vbPALAw==","signature_status":"signed_v1","signed_at":"2026-07-05T00:03:03.373631Z","signed_message":"canonical_sha256_bytes"},"source_id":"1909.03198","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:fbbc40ef6cc29b752a321ee1d381d32c15eda92f6fa9dd05a1af2939223912c0","sha256:b0b93032e8564901ee8309e270f7aa8fe370acdca630701e94310588a472f75f"],"state_sha256":"3ab48b248fdf586c2bcc637165e50942a0c629d73b37c3fbcf9469e970ce50d3"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"V+skm37yWHCb0ZismutdFt2aQuEdTbt2DR7coG0eLRNAofLfol3d4fg7B2A2xy/BR+aBghqqGjQiFYRl0StpDQ==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-16T04:33:35.667317Z","bundle_sha256":"bb07af5d83a7fbeb026f7a939620c4b3dfd84d0d2f55402f9b7b7c2f02cc6ecb"}}