{"as_of":"2026-08-17T08:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6260ebdf637c7a2a10a0783482f273812bfe9a0d9842398ce10209b9adeb897","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:44:16.530086Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18044/citation-record","integrity":"/paper/2505.18044/integrity","json":"/paper/2505.18044/citation-record.json","paper":"/paper/2505.18044"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:27.312089Z","title":"Improved algorithms for linear stochastic bandits.Advances in Neural Information Processing Systems, 24, 2011","venue":null,"work_id":"1f5d3bf8-f534-43a1-9e62-1b27da42184e","year":2011},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.019563Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:225bd02462e2983f405b6a0ae08dcc817a6388143f6a3352c484e65c9bb75ea2","observation_id":"dc186288-6cb8-4ced-95f5-554b82e2a0c9","resolution":{"observed_at":"2026-08-07T14:44:27.385792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:27.082043Z","title":"Model-based rein- forcement learning with value-targeted regression","venue":null,"work_id":"18e0761d-8e83-42c3-a159-b29d99d7c5df","year":2020},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.070077Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:5b0bf08a48574433a1585ff641936213de8a6a59d5b78458624f94c2ff108505","observation_id":"bb835027-f4f9-4f05-93ca-afff8eca1798","resolution":{"observed_at":"2026-08-07T14:44:27.195035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:26.854003Z","title":"Robust reinforcement learning using least squares policy iteration with provable performance guarantees","venue":null,"work_id":"4fe4df6c-be18-447f-bde5-fcdcb07e82cf","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.135324Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:5d4ab5461351fd9489550ec3463fecf68a9c136f80ef46179fe6c3587878aa0a","observation_id":"38a13ecd-1e1d-4364-8365-9ae7148b5933","resolution":{"observed_at":"2026-08-07T14:44:26.981351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:26.704233Z","title":null,"venue":null,"work_id":"0dea36ef-9455-4a7a-a384-6eeb5b81ed87","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.254486Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:e0d68dc372e28f462c312bfbf7934b09ed07a3ac838d4a6c1071e918294cc7a2","observation_id":"00956383-db3a-4030-bb26-9b74abc7e6f1","resolution":{"observed_at":"2026-08-07T14:44:26.789328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:26.453389Z","title":"Provably efficient exploration in policy optimization","venue":null,"work_id":"90fd20a1-08fc-4ce7-ba8c-66b1cfd427e1","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.322725Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:5370f4b12d62c45769db360ed50274f5baa6a00e754efe713fab61fbfc866f1c","observation_id":"1dd62c58-047c-4ffc-8b5b-baf919b0cf50","resolution":{"observed_at":"2026-08-07T14:44:26.541681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13187","last_updated":"2025-03-08T06:36:16Z","snapshot_observed_at":"2026-08-17T04:40:29.817573Z","submitted_at":"2025-02-18T12:57:29Z","title":"A Survey of Sim-to-Real Methods in RL: Progress, Prospects and Challenges with Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13187","snapshot_observed_at":"2026-08-07T14:44:10.442723Z","title":"A survey of sim-to-real methods in rl: Progress, prospects and challenges with foundation models.arXiv preprint arXiv:2502.13187, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.442723Z"},"links":{"cited_paper":"/paper/2502.13187","citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:54db067626a60f4819bace83e300e09a2ae99ccfb73ae7dfcc7360387002ad58","observation_id":"3f20851a-ba71-43a7-af1d-095e670e23a8","resolution":{"observed_at":"2026-08-07T14:44:10.442723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:26.167210Z","title":"Off-dynamics reinforcement learning: Training for transfer with domain classifiers","venue":null,"work_id":"257d2385-d8ba-4715-9e00-e643f4544f07","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.544737Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:41d4819176e959ec8abd74a9054202ba90889949389652ea85f32e987075017c","observation_id":"19a16ae0-0857-41d3-ae1b-e2da5c47ff67","resolution":{"observed_at":"2026-08-07T14:44:26.293774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:25.862138Z","title":"Birkhauser Boston Inc., 1989","venue":null,"work_id":"c08a9c59-ac74-4a74-8355-14b9de75cf96","year":1989},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.646720Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:575f7e4b341e801d95e050903867d2f1bbe10ffc0af529f8ec49787fb8c3e685","observation_id":"54623bc2-edaa-4cb8-993d-1db9562a20cc","resolution":{"observed_at":"2026-08-07T14:44:25.988409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:25.599440Z","title":"Robust markov decision processes: Beyond rectangu- larity.Mathematics of Operations Research, 48(1):203–226, 2023","venue":null,"work_id":"1ead0f2e-b473-4579-afe1-a68c35eed8cb","year":2023},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.741252Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:ef1bfa82f76a38d1ee8d90e400155389d75a95e1382182201ca0ec01c8ef1516","observation_id":"7ab5c91c-f782-4b02-9065-0bc0a743a499","resolution":{"observed_at":"2026-08-07T14:44:25.708718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:25.297908Z","title":"Off-dynamics reinforcement learning via domain adaptation and reward augmented imitation","venue":null,"work_id":"a8b07fe7-bcad-44b1-964b-10d82b5f0063","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.836792Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:01fbbcb5190cb42704c20e717df94c05d66152f8d4ed93c517d44514d2be4f5c","observation_id":"3fa3af11-b595-4805-931b-4d939d270587","resolution":{"observed_at":"2026-08-07T14:44:25.473463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.965179Z","title":"Kullback-leibler divergence constrained distributionally robust optimization.Available at Optimization Online, 1(2):9, 2013","venue":null,"work_id":"8723657a-b607-463d-9330-a4920e67e4bc","year":2013},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.941541Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:fddd7832a05ca6cf3a6da130213d4d24808822bfd4ddc42d6f3b22259934849b","observation_id":"8cf0cc27-d3e2-42cc-94fc-00e9988764f3","resolution":{"observed_at":"2026-08-07T14:44:25.114752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.715883Z","title":"Robust dynamic programming.Mathematics of Operations Research, 30(2): 257–280, 2005","venue":null,"work_id":"f5e4546e-8b72-4668-a61a-bad8ee21102d","year":2005},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.093164Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:d581f1e263d24b7e3cb94bda8b22d23826b50f1b309e372f41c5cb7539ee9ab0","observation_id":"26f5d310-fae8-4dec-9df9-918a18143f24","resolution":{"observed_at":"2026-08-07T14:44:24.825016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.526739Z","title":"Model-based reinforcement learning with value-targeted regression","venue":null,"work_id":"83257459-fffa-433d-a5db-29f527ef5af2","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.207448Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:00ca658d7d8c5b6104bd096d604fef4a9a0b3c72dc1457b268ac6edb35933d47","observation_id":"1133a7aa-aac7-4269-9920-365395c561b4","resolution":{"observed_at":"2026-08-07T14:44:24.634036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.302977Z","title":"Reinforcement learning in robotics: A survey","venue":null,"work_id":"4d4627ed-e3e2-44f4-86e6-fecc4be3048e","year":2013},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.315068Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:3bfdb8310e9d1b95f917d83504c61ad233ded6cf60fc7efd174c51f361b3bb49","observation_id":"9681b5ac-3886-4ad9-a7e8-705f2973edb4","resolution":{"observed_at":"2026-08-07T14:44:24.415638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.108432Z","title":"The transferability approach: Crossing the reality gap in evolutionary robotics.IEEE Transactions on Evolutionary Computa- tion, 17(1):122–145, 2012","venue":null,"work_id":"8e26cc62-4104-4586-8bf8-569cc85fbc02","year":2012},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.487182Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:17dcc4ea99b459a007a9d5183424372a8d09bed1c96fe4c656db1cf436d641ca","observation_id":"a8f9b543-73ed-47b2-be81-feb4db80c716","resolution":{"observed_at":"2026-08-07T14:44:24.211608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.907295Z","title":"Improved algorithm for adversarial linear mixture mdps with bandit feedback and unknown transition","venue":null,"work_id":"679e9009-d33b-4b38-82f5-335e42f8a96f","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.642883Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:0371476ff511395fada022eb013857a5ae1f4618b12e08f2c77db180bfeff275","observation_id":"537e3031-7b53-4ac4-84f6-ac234e66cc16","resolution":{"observed_at":"2026-08-07T14:44:23.992506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:11.789167Z","title":"Policy gradient algorithms for robust mdps with non-rectangular uncertainty sets.arXiv preprint arXiv:2305.19004, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.789167Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:cff68332b4e3d82dac211085630942a488b9c8fe6a9799857e1b657a588aaa50","observation_id":"9e4b0ec0-dad0-4e2b-8215-312c05ec1e7f","resolution":{"observed_at":"2026-08-07T14:44:11.789167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.677903Z","title":"Distributionally robust off-dynamics reinforcement learning: Prov- able efficiency with linear function approximation","venue":null,"work_id":"2c154d68-6ec7-4f90-ad7e-89e772bf6704","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.853527Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:b49b26a625636401f0ac0dab95acc320abb4b70b18e6886f03ed99d07c95c085","observation_id":"c0a9d7d5-2e5b-490a-9ce1-c4a8d716093d","resolution":{"observed_at":"2026-08-07T14:44:23.793901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.481757Z","title":"Minimax optimal and computationally efficient algorithms for distributionally robust offline reinforcement learning","venue":null,"work_id":"7d098a6f-3806-41a9-b1ca-6c6df4d52934","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.967284Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:3abb6aa2afa010b847d7fa0589096b9b5ba6ed8da2dd6662415d21b7acfe5347","observation_id":"0dc062d7-014f-4736-813b-841708978fd2","resolution":{"observed_at":"2026-08-07T14:44:23.553624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20521","last_updated":"2024-09-30T17:21:15Z","snapshot_observed_at":"2026-08-16T13:14:02.107912Z","submitted_at":"2024-09-30T17:21:15Z","title":"Upper and Lower Bounds for Distributionally Robust Off-Dynamics Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20521","snapshot_observed_at":"2026-08-07T14:44:12.083195Z","title":"Upper and lower bounds for distributionally robust off-dynamics reinforcement learning.arXiv preprint arXiv:2409.20521, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.083195Z"},"links":{"cited_paper":"/paper/2409.20521","citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:864a4c8d67659956eaac0d3825aa928f94ff7992ff6b6848e2f86f70bf9b541c","observation_id":"63daded1-ac5d-49ab-99aa-5b63af275ba0","resolution":{"observed_at":"2026-08-07T14:44:12.083195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.346575Z","title":"Distributionally robust reinforcement learning with interactive data collection: Fundamental hardness and near-optimal algorithms","venue":null,"work_id":"c81e7986-c388-4cdc-beaa-aff4dfacec59","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.199629Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:02422e076a1d1297285282c9be3b565d34c08dd398d6b3cea097826f55c411a1","observation_id":"95e6eb6c-acaa-4371-9d67-69ea426d175c","resolution":{"observed_at":"2026-08-07T14:44:23.385864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06620","last_updated":"2023-01-27T14:08:06Z","snapshot_observed_at":"2026-08-16T16:32:35.044516Z","submitted_at":"2022-09-14T13:17:59Z","title":"Distributionally Robust Offline Reinforcement Learning with Linear Function Approximation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06620","snapshot_observed_at":"2026-08-07T14:44:12.293596Z","title":"Distributionally robust offline reinforcement learning with linear function approximation.arXiv preprint arXiv:2209.06620, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.293596Z"},"links":{"cited_paper":"/paper/2209.06620","citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:136a3938e65f12fbe423ae52366237502bf3c76f40d172a0c5f55c86224f9757","observation_id":"b85144d0-96dd-4589-b3c1-7a46c22f8c9f","resolution":{"observed_at":"2026-08-07T14:44:12.293596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.261103Z","title":"Finite mixture models.Annual review of statistics and its application, 6(1):355–378, 2019","venue":null,"work_id":"82486b93-80d3-4e46-84aa-aef1425ef2d8","year":2019},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.397984Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:f353378a00ee9e28285fafbdec47e0feb4faa1b8addc8bf6dab142f22a0ab908","observation_id":"0c3ffa72-4d05-4171-ad13-ea9788ec4a94","resolution":{"observed_at":"2026-08-07T14:44:23.288836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.212794Z","title":"A simplex method for function minimization.The computer journal, 7(4):308–313, 1965","venue":null,"work_id":"273be59e-1dbf-40dd-b466-7c56c0f03099","year":1965},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.495205Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:a0093b6fa58f50b7b9e8cdb396677563a75a2add06f3bb996f7e7f26ec3590d3","observation_id":"44bb74d5-08e3-42dd-ae8a-af04cf923cc2","resolution":{"observed_at":"2026-08-07T14:44:23.223487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.122131Z","title":"Robust control of markov decision processes with uncertain transition matrices.Operations Research, 53(5):780–798, 2005","venue":null,"work_id":"7afa2cf4-d638-4611-bd73-837adaff8cf6","year":2005},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.579883Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:0e33c64a459fe549d341c1b2fc9a7c0a4aa3bd5b5331b8958af6f560edc984ec","observation_id":"67835c7f-4f71-4a3e-97e5-8b9fc42752ed","resolution":{"observed_at":"2026-08-07T14:44:23.169848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:22.870876Z","title":"Robustness in markov decision problems with uncertain transition matrices.Advances in Neural Information Processing Systems, 16, 2003","venue":null,"work_id":"bfd4e7e6-4eb1-4750-bd3a-a858aab20260","year":2003},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.671049Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:1cd5da34584d0c0615651adad25ef9370e477f38257a592b888f174ce15ad12c","observation_id":"839e7291-ab3a-497e-8e24-f86eb3b3790a","resolution":{"observed_at":"2026-08-07T14:44:23.014790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12282","last_updated":"2019-03-15T17:58:23Z","snapshot_observed_at":"2026-08-14T18:07:38.944749Z","submitted_at":"2018-10-29T17:51:46Z","title":"Assessing Generalization in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12282","snapshot_observed_at":"2026-08-07T14:44:12.736776Z","title":"Assessing generalization in deep reinforcement learning.arXiv preprint arXiv:1810.12282,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.736776Z"},"links":{"cited_paper":"/paper/1810.12282","citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:9bce7526ea1c88131b5d49b2d34f9da6b3e7d0e00aecc9ac0eb7745c54c75934","observation_id":"18d66843-81be-44cc-aa87-48dd55c772f0","resolution":{"observed_at":"2026-08-07T14:44:12.736776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:22.616761Z","title":"Bridging distributionally robust learning and offline rl: An approach to mitigate distribution shift and partial data coverage","venue":null,"work_id":"f8a04e44-8d2e-4dc3-9b17-60a4cff863db","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.810675Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:97ccc0698306d3b81fdb78afa9261a76572085a666811add3fd534b296c9658f","observation_id":"4142db4e-26e7-4179-b4b9-ce97031e44e5","resolution":{"observed_at":"2026-08-07T14:44:22.701706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:22.448118Z","title":"The infinite gaussian mixture model.Advances in Neural Information Processing Systems, 12, 1999","venue":null,"work_id":"b5bf8c2a-8630-4d6c-b0af-b8b7a73d143c","year":1999},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.922041Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:f9ca42beae7b7cf28bc4f7f6060df736904489169e82051bfc8e58f9f17b74ef","observation_id":"e8fd1073-752e-49a0-92fe-9ccba380a9ab","resolution":{"observed_at":"2026-08-07T14:44:22.533967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:22.243240Z","title":"Gaussian mixture models.Encyclopedia of biometrics, 741(659-663): 3, 2009","venue":null,"work_id":"8676ac7c-4311-4da4-ad2e-d82282d282c3","year":2009},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.982231Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:3c2e7c712775a4d10cdbaa7dde17aeb3bf1d0e1bbf69b8ae070bc054a6245c27","observation_id":"45337095-b368-4d61-abe8-bec4486f2fed","resolution":{"observed_at":"2026-08-07T14:44:22.342941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:22.097763Z","title":"Markovian decision processes with uncertain transition probabilities.Operations Research, 21(3):728–740, 1973","venue":null,"work_id":"5091ae4c-65aa-4830-a50f-b18cbf4b8a08","year":1973},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.089462Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:d785ba19927fee2d03eee080121eb15bbe4ec5a781b1a87684ffbeb33f94b729","observation_id":"e64b59e7-8913-4b22-a6da-19a224eb9698","resolution":{"observed_at":"2026-08-07T14:44:22.165116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.937484Z","title":"Distributionally robust model-based offline reinforcement learning with near-optimal sample complexity.Journal of Machine Learning Research, 25(200):1–91,","venue":null,"work_id":"aab1f5f2-de09-4dc4-b33e-62faa91280e7","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.224367Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:0f028fc714816190981beca2fa506008e3d9abcabb2184056cb6d7c2bd8eb39c","observation_id":"942aebe0-2956-4962-aff9-008cd03e2f88","resolution":{"observed_at":"2026-08-07T14:44:22.019192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.721925Z","title":"The curious price of distributional robustness in reinforcement learning with a generative model.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"9eb65698-51d5-43ba-802b-f1324b4cbf7b","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.360333Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:43fd47e1b75fc144eb6b615ac1112fb36ca8e69c94b2c4af672b42381aefcdb5","observation_id":"ac69338f-c324-45ef-b6b7-b78ecf2e27b3","resolution":{"observed_at":"2026-08-07T14:44:21.820136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:13.540609Z","title":"Robust offline reinforcement learning with linearly structuredf-divergence regularization.arXiv preprint arXiv:2411.18612, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.540609Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:386901c2b4884e0fcbdd0bdfa83e9f1d46cfe4959ed88809277a4e904fef365e","observation_id":"1bc9241f-01ad-4e82-9451-126cbac39427","resolution":{"observed_at":"2026-08-07T14:44:13.540609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.521694Z","title":"Pessimistic model-based offline reinforcement learning under partial coverage","venue":null,"work_id":"341c8e71-5bba-49d4-a581-5e56b8f8cf6e","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.759936Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:a29377870ceb9f9e9fb52cf77d494c1d3a91a6ad5483bd927e7e0b8ad5a2b481","observation_id":"b1cf2ff8-fe45-4251-b08c-791f50ab0925","resolution":{"observed_at":"2026-08-07T14:44:21.615475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.349821Z","title":"Sample complexity of offline distributionally robust linear markov decision processes","venue":null,"work_id":"229b474e-ffc2-4ff2-8b10-ffbaed90a4f6","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.955582Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:03da4a2afaf7ed519bd1d8f060dff5fa524a5c45d4475553dd42aad7728b411f","observation_id":"3e8d53b8-5bfb-4d31-816b-e06f9bef2976","resolution":{"observed_at":"2026-08-07T14:44:21.435252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:14.180938Z","title":"Return augmented decision transformer for off-dynamics reinforcement learning.arXiv preprint arXiv:2410.23450, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:14.180938Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:80d98e17576aaa19f759efd85f714059ba985d7b1f0b408496d16d0d8fdaec36","observation_id":"48e2cbd0-62f7-4b33-aa0d-c0db5afc2550","resolution":{"observed_at":"2026-08-07T14:44:14.180938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.240896Z","title":"Robust markov decision processes","venue":null,"work_id":"492c2ef3-fdf7-4efd-9a9a-557cb1253f5e","year":2013},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:14.366644Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:15c33591cba1949a5c7bbb25eb9863538c1611b12f0d282ad436eef933e007e5","observation_id":"e85e83e1-f41d-410e-990b-32bc20e4b662","resolution":{"observed_at":"2026-08-07T14:44:21.282437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.024089Z","title":"Mutual alignment transfer learning","venue":null,"work_id":"4a67e622-eb73-4b22-8daf-90a6aded9009","year":2017},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:14.512261Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:bc6b941bb933a99d43e96531fc8952060b6579554f9373d60ed4f10cc74d4622","observation_id":"5cd48174-e78c-4762-9c2e-2fc32074bb3d","resolution":{"observed_at":"2026-08-07T14:44:21.148819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:20.694948Z","title":"The robustness-performance tradeoff in markov decision processes","venue":null,"work_id":"5a0abf72-1b92-4bbc-aa53-a0b4785e4b45","year":2006},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:14.695106Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:f0f30d87e531a4869b36fe304455acba0d0ae5a7ba94ac37a8602980b3a059fd","observation_id":"f019cdc2-eb5f-4a4f-b270-8c78b598182f","resolution":{"observed_at":"2026-08-07T14:44:20.851485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:20.430864Z","title":"Improved sample complexity bounds for distributionally robust reinforcement learning","venue":null,"work_id":"c2f98723-2f1d-4f1a-b36b-e4c362ed2bf8","year":2023},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:14.854406Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:347a117c41400a704487585d1f1c57b5fe2a31e2970663bf0d9b216a17bdd24a","observation_id":"4c789318-dc3a-46c2-942a-78328245af70","resolution":{"observed_at":"2026-08-07T14:44:20.560793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:20.181275Z","title":"Toward theoretical understandings of robust markov decision processes: Sample complexity and asymptotics.The Annals of Statistics, 50 (6):3223–3248, 2022","venue":null,"work_id":"4a51bd94-cd24-4e61-b492-013f08c5d603","year":2022},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.061034Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:6dc230c8f07d717acf2accdf1055dabcbaa6a7dfa7577b72a64ad25adf7f774e","observation_id":"48fe2c9b-761c-4683-95c9-cbe1ca36377a","resolution":{"observed_at":"2026-08-07T14:44:20.325566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:19.939675Z","title":"Reward-free model-based reinforcement learning with linear function approximation.Advances in Neural Information Processing Systems, 34:1582–1593, 2021","venue":null,"work_id":"d6325a17-50a4-44e6-b23f-db3d23519ddf","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.218794Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:377d832c3cca6593ba5faee5e2a4838936eb93a6dedaaebb1d144da7927560b9","observation_id":"9ea4557c-3d4f-4c06-8821-0998a738ab90","resolution":{"observed_at":"2026-08-07T14:44:20.071385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:19.556108Z","title":"Learning adversarial linear mixture markov decision processes with bandit feedback and unknown transition","venue":null,"work_id":"00a90741-7a31-428b-957e-962f6ec04c88","year":2023},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.452113Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:7f841801df526a61ce15bb70255587ae7e1de9165ff5bcf43f95e6dd0c93db58","observation_id":"c9bd51f5-0c82-4c63-b83e-3b55b28179df","resolution":{"observed_at":"2026-08-07T14:44:19.715374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:19.135689Z","title":"Sim-to-real transfer in deep reinforcement learning for robotics: a survey","venue":null,"work_id":"834b8e4b-d137-4801-a7e6-6941b12469c6","year":2020},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.598520Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:ff5442d77a0c65cc6afeb63511acb34ea04284d3e8596d5224de4455f8903efd","observation_id":"64543293-787a-4e7d-9421-ba5098cc83b2","resolution":{"observed_at":"2026-08-07T14:44:19.344128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:18.775510Z","title":"Nearly minimax optimal reinforcement learning for linear mixture markov decision processes","venue":null,"work_id":"46b31d66-fea6-4063-a570-76e9fba134f2","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.708272Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:d806e1607337b8723873932f93cfeb7ce623a56df30e6a26c33a7e0111ca1aaa","observation_id":"c31db8ea-24ae-41f8-9c98-2f9ac1ce89a9","resolution":{"observed_at":"2026-08-07T14:44:18.984048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:18.467622Z","title":"Provably efficient reinforcement learning for discounted mdps with feature mapping","venue":null,"work_id":"072956bb-963a-47c6-bf41-c5a874594517","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.877799Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:99612bf329a78badfb4a780d7e7b5db385f8f1ea1c00e4833fb78af95739f274","observation_id":"e07a3f5e-17ce-4ad3-bd72-8388f5f6787a","resolution":{"observed_at":"2026-08-07T14:44:18.616950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:18.082477Z","title":"Natural actor-critic for robust reinforcement learning with function approximation","venue":null,"work_id":"be4bce5b-cffb-4c99-87fa-dbb0e55d6f62","year":2023},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:16.093379Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:3ed3918b948324a0061be2f18111bf791334ccfe8f63aebc72fc8960717f4c90","observation_id":"749cdfc5-2079-4a84-9f5c-0edfc4defa36","resolution":{"observed_at":"2026-08-07T14:44:18.244415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:17.716676Z","title":"Finite-sample regret bound for distributionally robust offline tabular reinforcement learning","venue":null,"work_id":"47675792-0562-45f5-ad6a-fbd5041985b9","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:16.285333Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:87d33f56ce99a1772de5bfc907da77b4f3937fda28bdb555e562fc33ee5c1f61","observation_id":"e0055a81-ecff-4ada-b7a5-12dacbbec727","resolution":{"observed_at":"2026-08-07T14:44:17.858529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:17.312400Z","title":"Time- constrained robust mdps.Advances in Neural Information Processing Systems, 37:35574–35611,","venue":null,"work_id":"bfd8ede8-6dfc-4f82-af23-4c1a1761305d","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:16.401146Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:6793ed899254becf9a58606a411c78751e63ab98c660840f44d38188098c5f58","observation_id":"832614ab-83b0-4b22-b97b-5e9906b73a12","resolution":{"observed_at":"2026-08-07T14:44:17.527348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:17.030394Z","title":"A.1 Proof of Theorem 3.4 Proof","venue":null,"work_id":"87634f63-90f5-49b5-a148-0bd0a7413af7","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:16.530086Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:703fe912f2486ad209060afe69e36ac7c4e497bb2e1a60ddee867f67153735c8","observation_id":"5a065462-4302-4047-8c1a-f3386aceef79","resolution":{"observed_at":"2026-08-07T14:44:17.145142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T15:06:44.123506Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2505.18044."}