{"as_of":"2026-08-15T10:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:180827ef2f8dd1af46f347d4bfbf0b11a2391751f4a999fd032860c4e8d8fb94","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:26:53.058645Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T09:56:20.351339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T09:57:00.793817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"cited_work":{"arxiv_id":"2505.19058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19058","snapshot_observed_at":"2026-07-10T09:57:00.793817Z","title":"Distributionally Robust Deep Q-Learning","venue":"cs.LG","work_id":"3f0ced19-0fb2-44de-8b8e-711cd16301a1","year":2025},"citing_paper":{"arxiv_id":"2606.20356","last_updated":"2026-06-18T15:20:00Z","snapshot_observed_at":"2026-08-09T06:29:58.990741Z","submitted_at":"2026-06-18T15:20:00Z","title":"Robust $Q$-learning for mean-field control under Wasserstein uncertainty in common noise","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-26T15:59:25.061726Z"},"links":{"cited_paper":"/paper/2505.19058","citing_paper":"/paper/2606.20356"},"observation_digest":"sha256:97711d1a2bec2cb9f63e34ebb5950f16a9530be1fd7a48c7f2b9d7e978ca813b","observation_id":"1aaa4507-cffe-4cfc-8c0a-8764e250a890","resolution":{"observed_at":"2026-07-04T05:29:35.432393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"cited_work":{"arxiv_id":"2505.19058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19058","snapshot_observed_at":"2026-07-10T09:57:00.793817Z","title":"Distributionally Robust Deep Q-Learning","venue":"cs.LG","work_id":"3f0ced19-0fb2-44de-8b8e-711cd16301a1","year":2025},"citing_paper":{"arxiv_id":"2607.08291","last_updated":"2026-07-09T09:34:50Z","snapshot_observed_at":"2026-08-13T00:14:09.195668Z","submitted_at":"2026-07-09T09:34:50Z","title":"Robustness in Sequential Decision Making under Evolving Uncertainty: Evidence from High-Frequency Market Making","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-07-10T09:56:20.351339Z"},"links":{"cited_paper":"/paper/2505.19058","citing_paper":"/paper/2607.08291"},"observation_digest":"sha256:62c142eea461ab222362a14acc55d237e38e354647485d51875f31dd8b5283b7","observation_id":"8e06f30b-2c3b-48d9-8ffd-d411166a95ae","resolution":{"observed_at":"2026-07-10T09:57:00.795026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19058/citation-record","integrity":"/paper/2505.19058/integrity","json":"/paper/2505.19058/citation-record.json","paper":"/paper/2505.19058"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.819502Z","title":"Investigating the parameters of the beta distribution","venue":null,"work_id":"67b73a70-ceef-4434-8692-73bf20c22fe1","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.148084Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:ebaff92fa8630db0fcb1e880760cb0e15d8d05b1cdcdfdab7ebc7fc3761d95ef","observation_id":"d56f98fb-9fae-4388-a4fb-338b43c8f91d","resolution":{"observed_at":"2026-08-07T14:26:59.823780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.805583Z","title":"Infinite dimensional analysis: a hitchhiker’s guide","venue":null,"work_id":"41adbbb3-7bf1-4082-ad1f-2e5a045010b9","year":2006},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.212428Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:433dc2f958ce1184108bfb22229548db758842d37cdbc931b7752a238566b4f7","observation_id":"9ac03d49-301b-462e-aa0e-f29bd48cd45e","resolution":{"observed_at":"2026-08-07T14:26:59.810211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.792132Z","title":"Computational aspects of robust optimized certainty equiv- alents and option pricing","venue":null,"work_id":"b0637214-0dc8-4247-a9b5-e2a634cf8c9a","year":2020},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.343157Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:44b1d3dc68ca3f1ad03e25c4abe9e05a693769636c819edc328368b3be2b7dca","observation_id":"b7f522da-e813-468e-a6b7-fbdbc4005c9e","resolution":{"observed_at":"2026-08-07T14:26:59.797222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.777832Z","title":"On the theory of dynamic programming","venue":null,"work_id":"459952a0-5948-4372-9e20-d4910a889bd4","year":1952},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.437965Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:c1d16e132504e1c5e96fef084d4e080ce36f7aa92cad19ceb66dab5b91f3d684","observation_id":"c17de44c-bf89-4428-b2f5-f41e89f22035","resolution":{"observed_at":"2026-08-07T14:26:59.783436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-07T14:26:47.529254Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.529254Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:d514c1323a2197ac31a0c7535b65ebd461682650a44f0c2d66ea24ec39f186ca","observation_id":"ae0c3ccc-57a8-4ac0-b321-2fa2e0c1c04d","resolution":{"observed_at":"2026-08-07T14:26:47.529254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.764585Z","title":"Convex optimization","venue":null,"work_id":"52cda15c-9e81-4614-896c-6efb46cf2896","year":2004},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.603514Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:def28c7642b8c4c5893f348864ef28624b63788788ad461641b0ad2fc7e177a9","observation_id":"fc8655b3-0994-46f6-b078-75faa5cf58a5","resolution":{"observed_at":"2026-08-07T14:26:59.768872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.753078Z","title":"Distributionally robust Markov decision processes and their connection to risk measures","venue":null,"work_id":"5d1af4c9-8ed7-46c3-a751-de6b7a7ca50c","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.723448Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:4eec8a191db3db08724c46799fbd4e69e17caef414e42c82def94b293ae840bf","observation_id":"335e8b6a-d2cc-430c-a794-e6c70c8e712c","resolution":{"observed_at":"2026-08-07T14:26:59.756832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.741010Z","title":null,"venue":null,"work_id":"a0656a4a-d9fe-4b9b-bb3a-451bb077fdf8","year":2001},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.813404Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:04e550a10022fa156a7946f87409afbcaaa2a2b6612351389084d7fdfb93219a","observation_id":"1461b9f8-e872-4b1c-8a58-f98767d84ecf","resolution":{"observed_at":"2026-08-07T14:26:59.745726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.725951Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport, 2013","venue":null,"work_id":"f4873aa6-e407-4ebe-805a-2057cef850a6","year":2013},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.913194Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:a58bf281d515d2c3193b5aa14612028f6f56d3bc6044dac9c224c5ed3b8ee94a","observation_id":"c8bb8b23-9445-48d0-bd0c-0f859f07c0a6","resolution":{"observed_at":"2026-08-07T14:26:59.730603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.04259","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.135866Z","title":"Robust Q-learning for finite ambiguity sets","venue":null,"work_id":"075d2374-7048-40d0-875b-e0823ea90990","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.992530Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:36719cd75e5aff446eaaf60aa506e92747ea819af4f770fcc60336e725e49c53","observation_id":"836e6293-d9a6-4848-a7b4-c4090a822da9","resolution":{"observed_at":"2026-08-07T14:26:54.193985Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06654","last_updated":"2023-03-12T13:03:28Z","snapshot_observed_at":"2026-08-14T16:19:48.203440Z","submitted_at":"2023-03-12T13:03:28Z","title":"Twice Regularized Markov Decision Processes: The Equivalence between Robustness and Regularization","version":1},"cited_work":{"arxiv_id":"2303.06654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.06654","snapshot_observed_at":"2026-08-07T14:26:53.861116Z","title":"Twice Regularized Markov Decision Processes: The Equivalence between Robustness and Regularization","venue":"cs.LG","work_id":"69282a33-3bd5-4b3e-a884-85b48cdaa065","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.113813Z"},"links":{"cited_paper":"/paper/2303.06654","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:9d22c67ee59b5fcd9c48cdfb9fa162b8b832b67cd28f7798e54b796332406ecf","observation_id":"757a9a1a-eb1b-4fc5-b04e-5637ca04f287","resolution":{"observed_at":"2026-08-07T14:26:53.921863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-08-15T01:37:35.814328Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-08-07T14:26:48.211513Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.211513Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:7864e73122ff174c704bd4f06b841293f5d121f80d462538a182aa09e228522d","observation_id":"016885b5-6336-4a61-83bc-6130eab112a1","resolution":{"observed_at":"2026-08-07T14:26:48.211513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.712731Z","title":"A theoretical analysis of deep Q-learning","venue":null,"work_id":"8e0d8c9f-789b-42b2-bc8c-ae00bc2f1c6d","year":2020},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.312156Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:f0afd15fd070a96f11ab101c0e8b398d14a54dc87f507e4fadb8d5ea38e5cf30","observation_id":"6ebf42a6-9e34-4417-be0d-d482898157cd","resolution":{"observed_at":"2026-08-07T14:26:59.717657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.699000Z","title":"In- terpolating between optimal transport and mmd using Sinkhorn divergences","venue":null,"work_id":"743684e0-349e-40da-9b5d-00fd15926d76","year":2019},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.411547Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:2f3a2d68a25e72c9416640da32351d35ab5ca74adda009281e857953b23ea59f","observation_id":"383dc3d1-25d8-4bb0-b7dc-22b3084143b2","resolution":{"observed_at":"2026-08-07T14:26:59.703610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.684224Z","title":"Sample complexity of Sinkhorn divergences","venue":null,"work_id":"c0afae55-beec-44a8-af85-051762536f80","year":2019},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.498761Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:398fdac50a17de886f09c6e79767ec41d9085e4f511e20d38f8318b463b5083f","observation_id":"742e4c8e-f8e8-491c-8a58-6d57f19be4c7","resolution":{"observed_at":"2026-08-07T14:26:59.689706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.671451Z","title":"Stability of entropic optimal transport and Schr¨ odinger bridges","venue":null,"work_id":"b9cc3da4-6268-4acb-9eb8-d181bd9e7134","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.596240Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:68af493b6e524a63542311c1dd2afe861f04599a923fb5f0a503967541b5f761","observation_id":"61f552e5-ee19-46ee-931f-1072e7e14675","resolution":{"observed_at":"2026-08-07T14:26:59.675743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.658847Z","title":"Robust Markov decision processes: Beyond rectangularity.Mathematics of Operations Research, 48(1):203–226, 2023","venue":null,"work_id":"ff55ac02-c7e1-49e2-8e5f-4303ae9c9fed","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.650603Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:8335b84b35895bb7bce2d11d5b8024f083b4b3ee250563ea0d626010d2adc2a5","observation_id":"80cc6a39-69e5-4015-b210-74594bae82a9","resolution":{"observed_at":"2026-08-07T14:26:59.663234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.645827Z","title":"Double Q-learning","venue":null,"work_id":"56965676-0e49-4435-8fa7-1cb0850b10ae","year":2010},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.760252Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:fb3065bb050156f748d9b4151c93ac61b9b492f3b9d9c9680392f0d00e7a7f2b","observation_id":"f6bfc4ed-785b-4e05-9a94-c43e1aedc790","resolution":{"observed_at":"2026-08-07T14:26:59.650585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:48.845231Z","title":"Universal approximation of an unknown mapping and its derivatives using multilayer feedforward networks","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.845231Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:9bb2cd2ca725e6f049b41a69608eb560de7bd9369518b1e6879f818ac7c66f2f","observation_id":"14cce011-4b45-4032-9112-e2dbd88ecc1b","resolution":{"observed_at":"2026-08-07T14:26:48.845231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:48.908999Z","title":"Learning to utilize shaping rewards: A new approach of reward shaping","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.908999Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:7d24a9facdedcbbc952b08fb1091c37ba4aefd8323e4487d34feb51376b1fe6d","observation_id":"b10a21ee-df77-4096-b7eb-947881c8ce83","resolution":{"observed_at":"2026-08-07T14:26:48.908999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.614965Z","title":"Robust dynamic programming","venue":null,"work_id":"43305a4e-c03b-46d4-a8cc-c44bfeb4b4d4","year":2005},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.942188Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:54dc13ff2e243730c9ab0cb92c0198a50b9c225ed90d105122a726c4ee92ee85","observation_id":"c468e487-5adc-4025-a1aa-9d4ca6407773","resolution":{"observed_at":"2026-08-07T14:26:59.619185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:49.009637Z","title":"Probability essentials","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.009637Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:31e9c7958feda703a9d6ea81e94594009a868b22a1288da834c3f7151007e578","observation_id":"54768045-e007-48f4-b640-1e1cf17b974a","resolution":{"observed_at":"2026-08-07T14:26:49.009637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:49.077557Z","title":"Universal approximation with deep narrow networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.077557Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:3bbe4330b77c2fea2e50b2e9d4046d1123333a5541542b7e9d8677315060a5f2","observation_id":"44bda2c0-d2e0-465a-95df-957062227227","resolution":{"observed_at":"2026-08-07T14:26:49.077557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.579531Z","title":"Probability theory: a comprehensive course","venue":null,"work_id":"bd35ec3e-c5d2-4438-8a53-e109d03eb352","year":2013},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.194831Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:2b34fd7bae39d63030082e8dca19b49d1006b8cc7dffa15de45941879f37ce4b","observation_id":"5daadba4-6eb4-4020-a685-1df0d1095287","resolution":{"observed_at":"2026-08-07T14:26:59.586840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13642","last_updated":"2023-01-31T13:54:23Z","snapshot_observed_at":"2026-08-14T12:43:23.554836Z","submitted_at":"2023-01-31T13:54:23Z","title":"An Efficient Solution to s-Rectangular Robust Markov Decision Processes","version":1},"cited_work":{"arxiv_id":"2301.13642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.13642","snapshot_observed_at":"2026-08-07T14:26:53.640499Z","title":"An Efficient Solution to s-Rectangular Robust Markov Decision Processes","venue":"cs.LG","work_id":"1b19003a-7340-4365-b59b-574931d347d9","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.284674Z"},"links":{"cited_paper":"/paper/2301.13642","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:6a9ba6fb4abfa2bdb5026770158bdf4717aea50ffe26a92d0fb4f93948a80b0e","observation_id":"2196972d-d2b4-4108-97d5-1b9403556f1d","resolution":{"observed_at":"2026-08-07T14:26:53.737945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.564130Z","title":"Playing fps games with deep reinforcement learning","venue":null,"work_id":"53e68334-bcd1-4c4a-a832-3fb3b6655e72","year":2017},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.444931Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:49ac59399f9e1ea6d379ee023519d02809ea5f6008ac91f0bf2aa4ff45dc68d3","observation_id":"7514de8d-3eea-48f6-971f-ef12ca6fd1ec","resolution":{"observed_at":"2026-08-07T14:26:59.570408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:49.568230Z","title":"Policy gradient algorithms for robust MDPs with non-rectangular uncertainty sets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.568230Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:a63d1e96ab668a096347860ac5c10f480f805be85aa0679adcd00e24ed19fd53","observation_id":"eb124f69-56be-46e8-bf84-c9cdfc65cddb","resolution":{"observed_at":"2026-08-07T14:26:49.568230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.439612Z","title":"On the efficiency of entropic regularized algorithms for optimal transport","venue":null,"work_id":"311121df-0f31-44b2-910c-7ad468c0263a","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.722090Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:dcf3f277d7082d36b2890077915919e7aaff2557441dec61265807e42ba5cc91","observation_id":"cc11521d-e1d2-4be7-b7f0-b84df17fb853","resolution":{"observed_at":"2026-08-07T14:26:59.547637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.144584Z","title":"Distri- butionally robust Q-learning","venue":null,"work_id":"ae965ef9-8ea4-4d7e-85a5-ee7315bf5a1d","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.840858Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:c63ea37ef414984ab1645cced1cdaa76ebdd9e1e8d0fbad38568c6a84b8ed4a4","observation_id":"c7092ac4-6b7b-4725-93a5-afb950f7fa7c","resolution":{"observed_at":"2026-08-07T14:26:59.293038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:49.934758Z","title":"Generative model for financial time series trained with MMD using a signature kernel","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.934758Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:2fce1a2f172d3144b9321a7fc190697b1d4d86a8bccbcac5cd9baf2479be17a2","observation_id":"2e2e4b44-ad3f-4779-b02b-8752d1864697","resolution":{"observed_at":"2026-08-07T14:26:49.934758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:58.691567Z","title":"Robust MDPs with k-rectangular uncertainty.Mathematics of Operations Research, 41(4):1484–1509, 2016","venue":null,"work_id":"f1bf0b32-7a38-4232-8874-1e46d9154d8b","year":2016},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.014471Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:a6d24073e22b9cba6a7d4f4624488dd77ee754348f609d61791c58f6660a573a","observation_id":"e7ebd7b1-035f-4e75-9410-b57014f7b327","resolution":{"observed_at":"2026-08-07T14:26:58.911349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:58.410938Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"7a681dcb-f4d8-4dd0-bb14-2f81e51e98a4","year":2015},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.133260Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:e3d54d1cd9a646237ee504f32e52f766a79ce55354f5e815dcc7a57a81f6420e","observation_id":"8e1c0b4b-89f1-4d19-ae29-31fa38fe1ceb","resolution":{"observed_at":"2026-08-07T14:26:58.541563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09532","last_updated":"2026-05-07T09:57:24Z","snapshot_observed_at":"2026-08-13T15:53:46.844813Z","submitted_at":"2024-03-14T16:21:32Z","title":"Robust SGLD algorithm for solving non-convex distributionally robust optimisation problems","version":4},"cited_work":{"arxiv_id":"2403.09532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09532","snapshot_observed_at":"2026-08-07T14:26:53.377291Z","title":"Robust SGLD algorithm for solving non-convex distributionally robust optimisation problems","venue":"math.OC","work_id":"ecdced07-8c7c-4fdc-9e04-7775579b93e2","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.237029Z"},"links":{"cited_paper":"/paper/2403.09532","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:c345e9514692ce3255560dff272c8054947c85bcbd18af6b2bf6192b66ee0147","observation_id":"d33f3249-3bb9-4739-af78-1e972bea358f","resolution":{"observed_at":"2026-08-07T14:26:53.421784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14759","last_updated":"2025-07-07T05:23:41Z","snapshot_observed_at":"2026-08-12T22:20:12.130217Z","submitted_at":"2024-10-18T09:53:20Z","title":"Universal approximation results for neural networks with non-polynomial activation function over non-compact domains","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14759","snapshot_observed_at":"2026-08-07T14:26:50.329080Z","title":"Universal approximation results for neural networks with non-polynomial activation function over non-compact domains","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.329080Z"},"links":{"cited_paper":"/paper/2410.14759","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:38f6736dbc84840dbddbe8e1cb8499ba336364124189b82c1116bdb3e504f81d","observation_id":"de0a5a18-4943-49b3-87de-d696a478000b","resolution":{"observed_at":"2026-08-07T14:26:50.329080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:58.195040Z","title":"Neural networks can detect model-free static arbitrage strategies","venue":null,"work_id":"f53e3ced-f8ba-450f-be0b-b99c3315a1c1","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.440013Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:70bc3557ccfa7ca64adf015ae2accfb92f308c643092c8c13002c64b8b33a06e","observation_id":"c1a5b965-ff5d-465a-bfc0-3bcb47d4fa5e","resolution":{"observed_at":"2026-08-07T14:26:58.294955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:57.924170Z","title":"Robust Q-learning algorithm for markov decision processes under Wasserstein uncertainty","venue":null,"work_id":"a032e3aa-44aa-4798-835f-c9e9a21c7785","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.518778Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:c38f225cf3b49c7490d1b6fbf0a3bbf47c539a849ce092347a72bd9cc6e8cc80","observation_id":"8042d1d6-830d-4a55-9209-fbb9db4e4e27","resolution":{"observed_at":"2026-08-07T14:26:58.082779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05230","last_updated":"2025-05-05T16:34:16Z","snapshot_observed_at":"2026-08-13T00:35:17.818115Z","submitted_at":"2024-04-08T06:53:05Z","title":"Non-concave stochastic optimal control in finite discrete time under model uncertainty","version":2},"cited_work":{"arxiv_id":"2404.05230","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.05230","snapshot_observed_at":"2026-08-07T14:26:53.197306Z","title":"Non-concave stochastic optimal control in finite discrete time under model uncertainty","venue":"math.OC","work_id":"680fdfd5-50ab-46ec-8e06-cd5b464e96c2","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.619941Z"},"links":{"cited_paper":"/paper/2404.05230","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:436ad0ab73f2b752c647a3dec1140a75cbbb73a47569e1c16f29bbc0e038a071","observation_id":"a298fc5b-8367-49f9-a359-13bf6d74ecac","resolution":{"observed_at":"2026-08-07T14:26:53.268456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:57.522922Z","title":"Markov decision processes under model uncertainty.Mathematical Finance, 33(3):618–665, 2023","venue":null,"work_id":"c76dc8f2-8c52-45fa-addb-cdd2806c166d","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.701032Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:e2ac1b93b182744bfb8194b2e0ddc848938750f9286bc52c88fa645e563fa2a0","observation_id":"d9cd9e9c-8e3a-42e0-a377-cd107430d60b","resolution":{"observed_at":"2026-08-07T14:26:57.698534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:57.404894Z","title":"Robust control of Markov decision processes with uncertain transition matrices","venue":null,"work_id":"8f03dbba-52ee-4306-9370-849d38abaab2","year":2005},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.787033Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:e272a76f47e4fb64445987187564bf4bea10856f05903508647fc362e43cbd92","observation_id":"2afa2ddc-496e-4315-bb2f-1cf669188761","resolution":{"observed_at":"2026-08-07T14:26:57.465811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:50.872266Z","title":"Introduction to entropic optimal transport","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.872266Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:49108d822c86104bdcbac1280c73624ac009ebc6e53968c2b2583441204b1b76","observation_id":"f2560ea4-7670-4b2b-a2bf-adbff400a0d5","resolution":{"observed_at":"2026-08-07T14:26:50.872266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:57.236549Z","title":"Robust reinforcement learning using offline data","venue":null,"work_id":"b918145b-2296-479b-a0a8-64313677bf35","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.954796Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:c0c307a7eb182b23768d725a64b41eac218170b0881a8f9fa7000a3c821528b5","observation_id":"b2049884-5728-4488-b3a3-ba753efab79c","resolution":{"observed_at":"2026-08-07T14:26:57.328939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:57.104924Z","title":"Approximation theory of the MLP model in neural networks","venue":null,"work_id":"7ba2235e-cf31-4baf-b381-ba159ee76166","year":1999},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.087991Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:600751b16a5939c7c739dc80edd9524e07cc9fa1f410ee66c4fe0c32089b0867","observation_id":"eea69139-5433-4db7-a707-11bffd83a295","resolution":{"observed_at":"2026-08-07T14:26:57.165931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.05659","last_updated":"2019-08-13T00:43:41Z","snapshot_observed_at":"2026-08-14T13:40:15.529458Z","submitted_at":"2019-08-13T00:43:41Z","title":"Distributionally Robust Optimization: A Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.05659","snapshot_observed_at":"2026-08-07T14:26:51.197695Z","title":"Distributionally robust optimization: A review","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.197695Z"},"links":{"cited_paper":"/paper/1908.05659","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:c199389b687325be1c5be25cad838d272f0be411002d74772222dc042e885b14","observation_id":"ddba481d-1872-4c3d-8d0d-08a0d80b2ec0","resolution":{"observed_at":"2026-08-07T14:26:51.197695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.963459Z","title":"Distributionally robust model-based reinforcement learning with large state spaces","venue":null,"work_id":"79c2473e-ddf3-476a-93c7-1ae0279cd41c","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.293275Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:93793522eebd3ae4922ff262c94e1122c839a9b85ff8e2fe48d9e82e8a404ce6","observation_id":"8cbb9b91-566c-43a2-b474-e6d9ec509828","resolution":{"observed_at":"2026-08-07T14:26:57.038771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.798469Z","title":"Principles of mathematical analysis , volume 3","venue":null,"work_id":"117bdd4f-be5a-451d-aca5-15e908475c74","year":1964},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.344975Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:050525524f25ec09f3873470cb08b7733bf5e8ce0c8478e7547eec1650f517c8","observation_id":"c1040ac8-a747-415d-883d-d2afbf624f0f","resolution":{"observed_at":"2026-08-07T14:26:56.883665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.718205Z","title":"Structural estimation of Markov decision processes","venue":null,"work_id":"48de1b3b-04f5-4633-915c-2aaf46da61ad","year":1994},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.495132Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:4714784faee2432b0edcb03f12813e34e5ccff0127c72f32e2b0658f7989e5b4","observation_id":"e4022c2a-03d7-4696-aefe-c7f312d7cf30","resolution":{"observed_at":"2026-08-07T14:26:56.753591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.568577Z","title":"Universal approximation using feedforward neural networks: A survey of some existing methods, and some new results","venue":null,"work_id":"7230e93e-39df-4606-9060-ead97bb201a5","year":1998},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.592726Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:f77c5297647b14c5d67fe4a150f61544f734c3b98b16e996a81d5e0f7741cdb8","observation_id":"de461997-29b7-4fbc-b4f7-2c936034e59a","resolution":{"observed_at":"2026-08-07T14:26:56.643022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.431524Z","title":"A relationship between arbitrary positive matrices and doubly stochastic matrices","venue":null,"work_id":"f16e7ba4-5669-467d-8a6a-089d421e3882","year":1964},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.691369Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:efdb62cc43e50c5e5c2edc0cbd2bc56a0241e3cbff2c74af713869e69cfaa36b","observation_id":"e5d9e8fa-928a-4bf0-bce8-48391be90837","resolution":{"observed_at":"2026-08-07T14:26:56.488784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.08708","last_updated":"2019-06-14T04:58:55Z","snapshot_observed_at":"2026-08-14T17:12:27.123077Z","submitted_at":"2019-02-23T00:13:42Z","title":"Distributionally Robust Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.08708","snapshot_observed_at":"2026-08-07T14:26:51.760331Z","title":"Distributionally robust reinforcement learning","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.760331Z"},"links":{"cited_paper":"/paper/1902.08708","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:c9845be11c71abe0ef8965e9716b05907bb1e1a7d0ec73f1f386aad2502168d5","observation_id":"66540415-4f95-4bf3-ab46-6545ddfb849a","resolution":{"observed_at":"2026-08-07T14:26:51.760331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:51.830034Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.830034Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:336555bb9299b26df6d9ac1ecf5b971922de548a4d559f33539a5811a8083a6a","observation_id":"94800049-d17f-4781-8b6f-e4ea6e729172","resolution":{"observed_at":"2026-08-07T14:26:51.830034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12958","last_updated":"2023-01-16T16:36:08Z","snapshot_observed_at":"2026-08-14T23:19:06.995747Z","submitted_at":"2019-10-28T20:40:37Z","title":"Sinkhorn Divergences for Unbalanced Optimal Transport","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12958","snapshot_observed_at":"2026-08-07T14:26:51.926466Z","title":"Sinkhorn divergences for unbalanced optimal transport","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.926466Z"},"links":{"cited_paper":"/paper/1910.12958","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:55734e64be1f26ef719e6151017f0cce490599a38169419df287aeefed368379","observation_id":"daddacaa-5731-4c90-af39-38eaa04cb3cb","resolution":{"observed_at":"2026-08-07T14:26:51.926466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.224120Z","title":"Deep reinforcement learning: From Q-learning to deep Q-learning","venue":null,"work_id":"f12abdac-7c93-4863-9b73-7ac123e2de98","year":2017},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.997657Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:34fbb83cfc1e65341919feb2f41dd3f583edb153dfb68a64397227ee8d197994","observation_id":"90a94789-bcdc-4323-8563-707e0907b41c","resolution":{"observed_at":"2026-08-07T14:26:56.330805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.060756Z","title":"Deep reinforcement learning with double Q-learning","venue":null,"work_id":"b4e1a803-3348-4b83-a587-b9765613cb69","year":2016},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.063423Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:22d73d70d09917c6eeb13163ad3b38a35e0e80ced031d1fe98be02a83e8beb3c","observation_id":"9eb8acb0-7ace-4c7a-a575-38fa53266750","resolution":{"observed_at":"2026-08-07T14:26:56.157590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:55.863674Z","title":"Springer, 2009","venue":null,"work_id":"1be55456-3118-4143-9197-41cca9168067","year":2009},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.124396Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:0c58fe45b7376c8e4dff62fd07499772ed07c8a73dbbe4321dda45b8944ab4fb","observation_id":"c2722181-b1d1-4d24-a021-bab0144a683b","resolution":{"observed_at":"2026-08-07T14:26:55.978372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11926","last_updated":"2025-03-26T16:30:42Z","snapshot_observed_at":"2026-08-13T18:05:25.728379Z","submitted_at":"2021-09-24T12:40:48Z","title":"Sinkhorn Distributionally Robust Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11926","snapshot_observed_at":"2026-08-07T14:26:52.197351Z","title":"Sinkhorn distributionally robust optimization.arXiv preprint arXiv:2109.11926, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.197351Z"},"links":{"cited_paper":"/paper/2109.11926","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:a149e2e436041b20cf9e29e8efae6c70001dff36ca62006bd53622281917787b","observation_id":"8a7301d0-28a0-4060-9ebc-8fe544c6c5b7","resolution":{"observed_at":"2026-08-07T14:26:52.197351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:55.692185Z","title":"Policy gradient in robust MDPs with global convergence guarantee, 2023","venue":null,"work_id":"11666016-495c-4c87-90ce-40d32f8d46e3","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.283186Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:bbf22d083466204d9c45a16f529c6babf884517a66ce5d43ddf3b3bd16d78a0d","observation_id":"d1c9673b-498d-493f-aa91-e2d8a0a25d65","resolution":{"observed_at":"2026-08-07T14:26:55.774906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:55.486457Z","title":"A finite sample complexity bound for distribu- tionally robust Q-learning","venue":null,"work_id":"9f35d510-c0e9-4ab1-a6df-c06f94a1d4f0","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.364238Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:00517c455cb6c16b6ee43ced4337286c7012f9d2385af4618482b9d3a493373b","observation_id":"5a9ea900-7541-46ae-8ad3-2da91d988d08","resolution":{"observed_at":"2026-08-07T14:26:55.587589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:55.334070Z","title":"Sample complexity of variance-reduced distribu- tionally robust Q-learning","venue":null,"work_id":"d65dedbc-3679-461d-a88b-f3bee5b7f4c3","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.436747Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:90be0102ff442924497ffc7bcb75d78e5e3c7abff985491bb5df3e26a4ae989a","observation_id":"1fdd2e0b-7b1d-4ce1-9e14-8bbca4e226fd","resolution":{"observed_at":"2026-08-07T14:26:55.405979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:52.508548Z","title":"Online robust reinforcement learning with model uncertainty","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.508548Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:eebad0d6ba026139560a62645d50c8052ce052af947f5f50ebdc4e53dfbf0269","observation_id":"e46641e0-b583-4a1a-a953-2f322065ca27","resolution":{"observed_at":"2026-08-07T14:26:52.508548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:55.147069Z","title":"Policy gradient method for robust reinforcement learning, 2022","venue":null,"work_id":"33608a4b-628a-4c1e-a76c-414382c4b5f3","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.591503Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:60828b0786cda4ee1d67ab1486d3163ff4b24075adbe61c563dba0c41902409d","observation_id":"a4a41a19-4422-4fd5-ae3a-fdaa96631e48","resolution":{"observed_at":"2026-08-07T14:26:55.215824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:52.659845Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.659845Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:61b740d8370759c5e2c80be6ba8b135e42867f405d4c5b1db64d5c22060e3f9d","observation_id":"0848a997-d20d-44f5-984c-55c6e2a6e9e0","resolution":{"observed_at":"2026-08-07T14:26:52.659845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.995656Z","title":"Robust Markov decision processes","venue":null,"work_id":"9744f97c-0cc6-499e-8e1c-d4975557dc22","year":2013},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.749919Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:fd64edce8461a87319d9e377e8ee0c8d990a7180a05224b904a3de7944e93f47","observation_id":"33fe3bf7-a23e-473b-bd21-36faa5913b7a","resolution":{"observed_at":"2026-08-07T14:26:55.057577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.809968Z","title":"Distributionally robust Markov decision processes","venue":null,"work_id":"a93b3cbc-8fd1-46be-9253-2ee66d69b8ce","year":2010},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.836265Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:b13cde495f6cb984700641cdb51e66296d5e6576fabe6d30f7f5eac502f0accf","observation_id":"1b3e7aef-70fb-45c3-88bd-798f2076fa29","resolution":{"observed_at":"2026-08-07T14:26:54.909557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.651076Z","title":"A convex optimization approach to distributionally robust Markov decision processes with Wasser- stein distance","venue":null,"work_id":"90114e46-e400-4c58-b462-7bbd5e04b44e","year":2017},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.904606Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:1f9225104fd696f7f505b8ac3eb6be84166ac42959671187d99b1f2b8a8868e2","observation_id":"fc240353-9188-43fd-8ea5-ac5677b2b03d","resolution":{"observed_at":"2026-08-07T14:26:54.728296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.462318Z","title":"Wasserstein distributionally robust stochastic control: A data-driven approach","venue":null,"work_id":"aadd789e-83c9-4640-8e2c-cbaabd4636ba","year":2020},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.969979Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:8bd575e2acf9b62b81ed7f4c9993d28eec646618d618704de1d4cab345fe41cd","observation_id":"8158a332-f577-4700-bfb1-88cf205a7ebc","resolution":{"observed_at":"2026-08-07T14:26:54.550806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.308845Z","title":"On linear optimization over Wasserstein balls","venue":null,"work_id":"ca8d11e8-5ecd-4438-9cb7-8827e1f70f03","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:53.058645Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:59f31d54a3340ee994af357a7e7aef3895ca2c44f3f31a8332386c98363e0379","observation_id":"1e5f6c2c-bf72-44e7-87f3-7a550d9b32ce","resolution":{"observed_at":"2026-08-07T14:26:54.369542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T09:09:10.633442Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":5,"verified_fuzzy":43},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2505.19058."}