{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2021:XWJC7IZXO46NCPC7NIZK46CSJG","short_pith_number":"pith:XWJC7IZX","canonical_record":{"source":{"id":"2112.10264","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-12-19T21:47:04Z","cross_cats_sorted":["math.OC","math.PR","stat.ML"],"title_canon_sha256":"255790aa8b6de39be163bb69abd23b52e344c4571fe34a62d848376dfc3b845a","abstract_canon_sha256":"7e37efd683be0b1451a6dfcc377f3d96bfa7658246e68de4f7fa5f3598c4224d"},"schema_version":"1.0"},"canonical_sha256":"bd922fa337773cd13c5f6a32ae785249adac1938f43bdd4683fe7a1c2cc8b130","source":{"kind":"arxiv","id":"2112.10264","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2112.10264","created_at":"2026-07-05T03:42:57Z"},{"alias_kind":"arxiv_version","alias_value":"2112.10264v1","created_at":"2026-07-05T03:42:57Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2112.10264","created_at":"2026-07-05T03:42:57Z"},{"alias_kind":"pith_short_12","alias_value":"XWJC7IZXO46N","created_at":"2026-07-05T03:42:57Z"},{"alias_kind":"pith_short_16","alias_value":"XWJC7IZXO46NCPC7","created_at":"2026-07-05T03:42:57Z"},{"alias_kind":"pith_short_8","alias_value":"XWJC7IZX","created_at":"2026-07-05T03:42:57Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2021:XWJC7IZXO46NCPC7NIZK46CSJG","target":"record","payload":{"canonical_record":{"source":{"id":"2112.10264","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-12-19T21:47:04Z","cross_cats_sorted":["math.OC","math.PR","stat.ML"],"title_canon_sha256":"255790aa8b6de39be163bb69abd23b52e344c4571fe34a62d848376dfc3b845a","abstract_canon_sha256":"7e37efd683be0b1451a6dfcc377f3d96bfa7658246e68de4f7fa5f3598c4224d"},"schema_version":"1.0"},"canonical_sha256":"bd922fa337773cd13c5f6a32ae785249adac1938f43bdd4683fe7a1c2cc8b130","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T03:42:57.338639Z","signature_b64":"99SRnZaN2/KwhViaYILAvrCXk0iMEDl6Ys0b4rI/1tw3+h2PAME2/zeX1ffTzvNEJusIFgFEdw5vnVoS+h+QBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"bd922fa337773cd13c5f6a32ae785249adac1938f43bdd4683fe7a1c2cc8b130","last_reissued_at":"2026-07-05T03:42:57.338250Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T03:42:57.338250Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2112.10264","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T03:42:57Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"nK4qpbIfGtYh1Lp4hFucd7V7iZOwVav4L64+Xm3EIDF0XZYYbzzx7UApDINm4wdNztPHTkWd0u9BJEuspNZBAw==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-15T22:11:55.837904Z"},"content_sha256":"00ef7d760f7c9739ac2c6802367f7a4e9397c9e69715a0a8f09813c335bee209","schema_version":"1.0","event_id":"sha256:00ef7d760f7c9739ac2c6802367f7a4e9397c9e69715a0a8f09813c335bee209"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2021:XWJC7IZXO46NCPC7NIZK46CSJG","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["math.OC","math.PR","stat.ML"],"primary_cat":"cs.LG","authors_text":"Lukasz Szpruch, Tanut Treetanthiploet, Yufei Zhang","submitted_at":"2021-12-19T21:47:04Z","abstract_excerpt":"We develop a probabilistic framework for analysing model-based reinforcement learning in the episodic setting. We then apply it to study finite-time horizon stochastic control problems with linear dynamics but unknown coefficients and convex, but possibly irregular, objective function. Using probabilistic representations, we study regularity of the associated cost functions and establish precise estimates for the performance gap between applying optimal feedback control derived from estimated and true model parameters. We identify conditions under which this performance gap is quadratic, impro"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2112.10264","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2112.10264/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T03:42:57Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"VRUQKMjleirCtt9wFe5th7djaK4A+OODhLr/by6v+eUDFPCV4liaOUq+Oc7RXQ8aWedX0rglj7CFEz3wMgtKCg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-15T22:11:55.838439Z"},"content_sha256":"64d088127eb974cf08c28a60b784f9ce40b619ab0303899e57d305b1f9297faa","schema_version":"1.0","event_id":"sha256:64d088127eb974cf08c28a60b784f9ce40b619ab0303899e57d305b1f9297faa"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/XWJC7IZXO46NCPC7NIZK46CSJG/bundle.json","state_url":"https://pith.science/pith/XWJC7IZXO46NCPC7NIZK46CSJG/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/XWJC7IZXO46NCPC7NIZK46CSJG/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-15T22:11:55Z","links":{"resolver":"https://pith.science/pith/XWJC7IZXO46NCPC7NIZK46CSJG","bundle":"https://pith.science/pith/XWJC7IZXO46NCPC7NIZK46CSJG/bundle.json","state":"https://pith.science/pith/XWJC7IZXO46NCPC7NIZK46CSJG/state.json","well_known_bundle":"https://pith.science/.well-known/pith/XWJC7IZXO46NCPC7NIZK46CSJG/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2021:XWJC7IZXO46NCPC7NIZK46CSJG","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"7e37efd683be0b1451a6dfcc377f3d96bfa7658246e68de4f7fa5f3598c4224d","cross_cats_sorted":["math.OC","math.PR","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-12-19T21:47:04Z","title_canon_sha256":"255790aa8b6de39be163bb69abd23b52e344c4571fe34a62d848376dfc3b845a"},"schema_version":"1.0","source":{"id":"2112.10264","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2112.10264","created_at":"2026-07-05T03:42:57Z"},{"alias_kind":"arxiv_version","alias_value":"2112.10264v1","created_at":"2026-07-05T03:42:57Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2112.10264","created_at":"2026-07-05T03:42:57Z"},{"alias_kind":"pith_short_12","alias_value":"XWJC7IZXO46N","created_at":"2026-07-05T03:42:57Z"},{"alias_kind":"pith_short_16","alias_value":"XWJC7IZXO46NCPC7","created_at":"2026-07-05T03:42:57Z"},{"alias_kind":"pith_short_8","alias_value":"XWJC7IZX","created_at":"2026-07-05T03:42:57Z"}],"graph_snapshots":[{"event_id":"sha256:64d088127eb974cf08c28a60b784f9ce40b619ab0303899e57d305b1f9297faa","target":"graph","created_at":"2026-07-05T03:42:57Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2112.10264/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"We develop a probabilistic framework for analysing model-based reinforcement learning in the episodic setting. We then apply it to study finite-time horizon stochastic control problems with linear dynamics but unknown coefficients and convex, but possibly irregular, objective function. Using probabilistic representations, we study regularity of the associated cost functions and establish precise estimates for the performance gap between applying optimal feedback control derived from estimated and true model parameters. We identify conditions under which this performance gap is quadratic, impro","authors_text":"Lukasz Szpruch, Tanut Treetanthiploet, Yufei Zhang","cross_cats":["math.OC","math.PR","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-12-19T21:47:04Z","title":"Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2112.10264","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:00ef7d760f7c9739ac2c6802367f7a4e9397c9e69715a0a8f09813c335bee209","target":"record","created_at":"2026-07-05T03:42:57Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"7e37efd683be0b1451a6dfcc377f3d96bfa7658246e68de4f7fa5f3598c4224d","cross_cats_sorted":["math.OC","math.PR","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2021-12-19T21:47:04Z","title_canon_sha256":"255790aa8b6de39be163bb69abd23b52e344c4571fe34a62d848376dfc3b845a"},"schema_version":"1.0","source":{"id":"2112.10264","kind":"arxiv","version":1}},"canonical_sha256":"bd922fa337773cd13c5f6a32ae785249adac1938f43bdd4683fe7a1c2cc8b130","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"bd922fa337773cd13c5f6a32ae785249adac1938f43bdd4683fe7a1c2cc8b130","first_computed_at":"2026-07-05T03:42:57.338250Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T03:42:57.338250Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"99SRnZaN2/KwhViaYILAvrCXk0iMEDl6Ys0b4rI/1tw3+h2PAME2/zeX1ffTzvNEJusIFgFEdw5vnVoS+h+QBw==","signature_status":"signed_v1","signed_at":"2026-07-05T03:42:57.338639Z","signed_message":"canonical_sha256_bytes"},"source_id":"2112.10264","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:00ef7d760f7c9739ac2c6802367f7a4e9397c9e69715a0a8f09813c335bee209","sha256:64d088127eb974cf08c28a60b784f9ce40b619ab0303899e57d305b1f9297faa"],"state_sha256":"b74203deaacb08a860381e68eac2a8eb0a191238574dfdfe827a2c7fa4f99dac"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"GozQSq/55TLT6sRlxuNG//o1XUbuimDk2eeV2q4icIxdgzN+tJTr0bizfaYtFRkj20qUrEKSUPF9+aKw83+8Dg==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-15T22:11:55.843153Z","bundle_sha256":"26d7c72e48cf81f9313d0e63d46fef65cda64a50f6b476ae74aa518dc00d0e11"}}