{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2023:RYHWARQYT6NYB2G6QFD3WNWIBF","short_pith_number":"pith:RYHWARQY","canonical_record":{"source":{"id":"2305.16589","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-05-26T02:32:03Z","cross_cats_sorted":["cs.IT","math.IT","math.ST","stat.TH"],"title_canon_sha256":"ec63f09c769d85323c06755dd5e09bfb53c2cca60e694c83be82bbbc012bcbdb","abstract_canon_sha256":"5435a6f3fcbd4b2b0d14e347d9aa6b2864e89a15f950b26c0426fd4078433ae8"},"schema_version":"1.0"},"canonical_sha256":"8e0f6046189f9b80e8de8147bb36c80948c8b4183c4ec7c433397581e37cddb1","source":{"kind":"arxiv","id":"2305.16589","version":3},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2305.16589","created_at":"2026-07-05T12:05:57Z"},{"alias_kind":"arxiv_version","alias_value":"2305.16589v3","created_at":"2026-07-05T12:05:57Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.16589","created_at":"2026-07-05T12:05:57Z"},{"alias_kind":"pith_short_12","alias_value":"RYHWARQYT6NY","created_at":"2026-07-05T12:05:57Z"},{"alias_kind":"pith_short_16","alias_value":"RYHWARQYT6NYB2G6","created_at":"2026-07-05T12:05:57Z"},{"alias_kind":"pith_short_8","alias_value":"RYHWARQY","created_at":"2026-07-05T12:05:57Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2023:RYHWARQYT6NYB2G6QFD3WNWIBF","target":"record","payload":{"canonical_record":{"source":{"id":"2305.16589","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-05-26T02:32:03Z","cross_cats_sorted":["cs.IT","math.IT","math.ST","stat.TH"],"title_canon_sha256":"ec63f09c769d85323c06755dd5e09bfb53c2cca60e694c83be82bbbc012bcbdb","abstract_canon_sha256":"5435a6f3fcbd4b2b0d14e347d9aa6b2864e89a15f950b26c0426fd4078433ae8"},"schema_version":"1.0"},"canonical_sha256":"8e0f6046189f9b80e8de8147bb36c80948c8b4183c4ec7c433397581e37cddb1","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:05:57.333365Z","signature_b64":"YxpsEROv5UXKQg/plev+N/uIW47hfpFnUbGf+wTPKDnRJPynlxt0sxF9HFKkeojBbUPaOi+N5Ts4pm0H+0hUBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8e0f6046189f9b80e8de8147bb36c80948c8b4183c4ec7c433397581e37cddb1","last_reissued_at":"2026-07-05T12:05:57.332718Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:05:57.332718Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2305.16589","source_version":3,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T12:05:57Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"JJNLi1A98mXM/SbaFlpqhatLnklnPOmQ1ruUWVO7mMskwkN/HmUV559hVsTPxqlYxDmj7kpzFC7CLFrAD6hLBA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-17T13:47:55.615891Z"},"content_sha256":"253bc1c2ad216286f407ef08e5b321688bfa720afdec0b6c434fc6c300b484c7","schema_version":"1.0","event_id":"sha256:253bc1c2ad216286f407ef08e5b321688bfa720afdec0b6c434fc6c300b484c7"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2023:RYHWARQYT6NYB2G6QFD3WNWIBF","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"The Curious Price of Distributional Robustness in Reinforcement Learning with a Generative Model","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.IT","math.IT","math.ST","stat.TH"],"primary_cat":"cs.LG","authors_text":"Gen Li, Laixi Shi, Matthieu Geist, Yuejie Chi, Yuting Wei, Yuxin Chen","submitted_at":"2023-05-26T02:32:03Z","abstract_excerpt":"This paper investigates model robustness in reinforcement learning (RL) to reduce the sim-to-real gap in practice. We adopt the framework of distributionally robust Markov decision processes (RMDPs), aimed at learning a policy that optimizes the worst-case performance when the deployed environment falls within a prescribed uncertainty set around the nominal MDP. Despite recent efforts, the sample complexity of RMDPs remained mostly unsettled regardless of the uncertainty set in use. It was unclear if distributional robustness bears any statistical consequences when benchmarked against standard"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.16589","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2305.16589/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T12:05:57Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"IxtfveQMp9Jti4kS/SMbxoN1Mym4OpIrJEHCppoiIgXNns8kZpywrjN73UsSpneGJNyMrolUL9iMXu/7R024AQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-17T13:47:55.616427Z"},"content_sha256":"ab62849c7177fbdaa6f57e6c145c082000b16ff678468c1dde40623e4150bf5b","schema_version":"1.0","event_id":"sha256:ab62849c7177fbdaa6f57e6c145c082000b16ff678468c1dde40623e4150bf5b"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/RYHWARQYT6NYB2G6QFD3WNWIBF/bundle.json","state_url":"https://pith.science/pith/RYHWARQYT6NYB2G6QFD3WNWIBF/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/RYHWARQYT6NYB2G6QFD3WNWIBF/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-17T13:47:55Z","links":{"resolver":"https://pith.science/pith/RYHWARQYT6NYB2G6QFD3WNWIBF","bundle":"https://pith.science/pith/RYHWARQYT6NYB2G6QFD3WNWIBF/bundle.json","state":"https://pith.science/pith/RYHWARQYT6NYB2G6QFD3WNWIBF/state.json","well_known_bundle":"https://pith.science/.well-known/pith/RYHWARQYT6NYB2G6QFD3WNWIBF/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2023:RYHWARQYT6NYB2G6QFD3WNWIBF","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"5435a6f3fcbd4b2b0d14e347d9aa6b2864e89a15f950b26c0426fd4078433ae8","cross_cats_sorted":["cs.IT","math.IT","math.ST","stat.TH"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-05-26T02:32:03Z","title_canon_sha256":"ec63f09c769d85323c06755dd5e09bfb53c2cca60e694c83be82bbbc012bcbdb"},"schema_version":"1.0","source":{"id":"2305.16589","kind":"arxiv","version":3}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2305.16589","created_at":"2026-07-05T12:05:57Z"},{"alias_kind":"arxiv_version","alias_value":"2305.16589v3","created_at":"2026-07-05T12:05:57Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.16589","created_at":"2026-07-05T12:05:57Z"},{"alias_kind":"pith_short_12","alias_value":"RYHWARQYT6NY","created_at":"2026-07-05T12:05:57Z"},{"alias_kind":"pith_short_16","alias_value":"RYHWARQYT6NYB2G6","created_at":"2026-07-05T12:05:57Z"},{"alias_kind":"pith_short_8","alias_value":"RYHWARQY","created_at":"2026-07-05T12:05:57Z"}],"graph_snapshots":[{"event_id":"sha256:ab62849c7177fbdaa6f57e6c145c082000b16ff678468c1dde40623e4150bf5b","target":"graph","created_at":"2026-07-05T12:05:57Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2305.16589/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"This paper investigates model robustness in reinforcement learning (RL) to reduce the sim-to-real gap in practice. We adopt the framework of distributionally robust Markov decision processes (RMDPs), aimed at learning a policy that optimizes the worst-case performance when the deployed environment falls within a prescribed uncertainty set around the nominal MDP. Despite recent efforts, the sample complexity of RMDPs remained mostly unsettled regardless of the uncertainty set in use. It was unclear if distributional robustness bears any statistical consequences when benchmarked against standard","authors_text":"Gen Li, Laixi Shi, Matthieu Geist, Yuejie Chi, Yuting Wei, Yuxin Chen","cross_cats":["cs.IT","math.IT","math.ST","stat.TH"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-05-26T02:32:03Z","title":"The Curious Price of Distributional Robustness in Reinforcement Learning with a Generative Model"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.16589","kind":"arxiv","version":3},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:253bc1c2ad216286f407ef08e5b321688bfa720afdec0b6c434fc6c300b484c7","target":"record","created_at":"2026-07-05T12:05:57Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"5435a6f3fcbd4b2b0d14e347d9aa6b2864e89a15f950b26c0426fd4078433ae8","cross_cats_sorted":["cs.IT","math.IT","math.ST","stat.TH"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-05-26T02:32:03Z","title_canon_sha256":"ec63f09c769d85323c06755dd5e09bfb53c2cca60e694c83be82bbbc012bcbdb"},"schema_version":"1.0","source":{"id":"2305.16589","kind":"arxiv","version":3}},"canonical_sha256":"8e0f6046189f9b80e8de8147bb36c80948c8b4183c4ec7c433397581e37cddb1","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"8e0f6046189f9b80e8de8147bb36c80948c8b4183c4ec7c433397581e37cddb1","first_computed_at":"2026-07-05T12:05:57.332718Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T12:05:57.332718Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"YxpsEROv5UXKQg/plev+N/uIW47hfpFnUbGf+wTPKDnRJPynlxt0sxF9HFKkeojBbUPaOi+N5Ts4pm0H+0hUBw==","signature_status":"signed_v1","signed_at":"2026-07-05T12:05:57.333365Z","signed_message":"canonical_sha256_bytes"},"source_id":"2305.16589","source_kind":"arxiv","source_version":3}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:253bc1c2ad216286f407ef08e5b321688bfa720afdec0b6c434fc6c300b484c7","sha256:ab62849c7177fbdaa6f57e6c145c082000b16ff678468c1dde40623e4150bf5b"],"state_sha256":"d84ad908fd1995b37ce17afbf3cc9303590f7f81a61b1bb11a608884cd9c95e9"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"RbSGGPm/7pBbeQK9KIJIqoUJ3r+y/kPDQlSTH27m6FWY2F9ubZP9DJq6AFQAq08coOaCagMZpIUI4Sf0phjHDA==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-17T13:47:55.622090Z","bundle_sha256":"628fbc150a12abc6f7e86abff326f82df80cb087fdd0a61fcd543154963f556a"}}