{"as_of":"2026-08-10T12:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fefd9abe707b35b0866ed1d13399041a8a8fc7b5a9f8f0d89c95a2481778d2e4","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:54:12.780877Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07040/citation-record","integrity":"/paper/2506.07040/integrity","json":"/paper/2506.07040/citation-record.json","paper":"/paper/2506.07040"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:17.377807Z","title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift","venue":null,"work_id":"0115c44f-1993-40a1-83c9-e6c5b3fad1e2","year":2021},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:09.616419Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:5d38c63ef2fc33a31ea5cacebef5fbf4b23e5b25b4e93c42777f6031668ef505","observation_id":"ef70f0d3-4b29-48c4-9680-c2a66502970f","resolution":{"observed_at":"2026-08-07T05:54:17.474894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:17.200425Z","title":"Bounded semigroups of matrices","venue":null,"work_id":"6bb1b64c-08d6-4772-8ecf-2cb497beb407","year":1992},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:09.707205Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:46a751dca55ee3cad4331ce4d615fb84413c9edcd91419e2f7ded8a728a89e22","observation_id":"9965448c-ccfe-4d5c-8797-9056a40d7186","resolution":{"observed_at":"2026-08-07T05:54:17.297043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.976155Z","title":"Single sample path-based optimization of markov chains","venue":null,"work_id":"f921d4c0-5f7b-4409-ac17-2829d31f5825","year":1999},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:09.869727Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:6f43c81f32a65908b7f78ee6be3faf25c7c7744b07e7bf368d403b3c291c7b01","observation_id":"9ef97421-6307-40dd-bbb8-6844ed0b88fa","resolution":{"observed_at":"2026-08-07T05:54:17.111742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:09.997942Z","title":"Sample complexity of distributionally robust average-reward reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:09.997942Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:e1dfef55ea344829c98def6c64e399d72ff16afe4649530752a918f25e06a76b","observation_id":"869a3cd3-5da4-42c8-8d7b-7d5f54645349","resolution":{"observed_at":"2026-08-07T05:54:09.997942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.801727Z","title":"Distributionally robust stochastic optimization with W asserstein distance","venue":null,"work_id":"419e05d7-3da2-424a-8634-e2bbe9af74a9","year":2022},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.170591Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:f97c8334a2ef97cd37237e58dc0dcf3ed87030203ee40ef3827a68149713b07c","observation_id":"61e2f1a7-d41a-4e96-be53-613e8558d664","resolution":{"observed_at":"2026-08-07T05:54:16.886561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.652330Z","title":"Distributionally robust stochastic optimization with wasserstein distance","venue":null,"work_id":"3391533f-50b8-4fff-ac06-871ae86f6b63","year":2023},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.326835Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:b3cd0ca64e7b098cb9cc92205e78f1f407475caaf22a0b92335c2892a15d8f1f","observation_id":"67561d46-dd68-4551-9c2d-42cc6c7d39d6","resolution":{"observed_at":"2026-08-07T05:54:16.737358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.497466Z","title":"Sim2real in robotics and automation: Applications and challenges","venue":null,"work_id":"2ad70b6c-5ab3-48aa-8c3d-191a43d3ce02","year":2021},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.442042Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:ccc6b077034e542063e901f420c872724d32761a47083d2f1e53ce98fc7a776d","observation_id":"825f67de-894c-4c02-bc88-01753b950a87","resolution":{"observed_at":"2026-08-07T05:54:16.572891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.312575Z","title":"A robust version of the probability ratio test","venue":null,"work_id":"b3013257-edff-45b8-aca4-57b004ebfc52","year":1965},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.553831Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:f5de1497afa1e7f0f72637162ae194bb147fa032bdc0248d2f2ff2ca66b769b5","observation_id":"7f309759-8e64-451a-a29d-50e69cfd7db2","resolution":{"observed_at":"2026-08-07T05:54:16.386215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.144294Z","title":"Robust dynamic programming","venue":null,"work_id":"c5eb672e-b503-4332-9536-22e851885b60","year":2005},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.666749Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:202bb720559441d3ed7712d0133ca7d9e260adf52def6e8f027d2457d130a226","observation_id":"ec7c81e9-8789-41b2-8b25-686b96860ea4","resolution":{"observed_at":"2026-08-07T05:54:16.227215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.929528Z","title":"Is q-learning provably efficient? Advances in neural information processing systems , 31, 2018","venue":null,"work_id":"7b61a24c-efd4-4a89-ad51-b14835b00339","year":2018},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.782406Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:ad3c6cc347204dd4c2d2a6a0d7967fc6c3c97ea777962f9fa30e5f4dbcf8af7a","observation_id":"19f8b178-7a01-43f6-9858-f64fdbe6a7ff","resolution":{"observed_at":"2026-08-07T05:54:15.999655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.744360Z","title":"Learning robust policy against disturbance in transition dynamics via state-conservative policy optimization","venue":null,"work_id":"06350dbd-7afe-4c06-803a-16ad24afd1c1","year":2022},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.965109Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:599aacc859ed7f58ea693303fd130db0d1b183897873737e7672a81c76655179","observation_id":"c88f8ffa-82e1-41a6-9ab9-6bcc34a47707","resolution":{"observed_at":"2026-08-07T05:54:15.849079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.571003Z","title":"Policy gradient for rectangular robust markov decision processes","venue":null,"work_id":"743c994b-79e4-4a5c-b089-f7ac60c5119c","year":2023},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.050545Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:c560f956fedb1183b4814196d952e413ee634369eadedb616ee00e659f2b412a","observation_id":"c16151e2-04d4-42a4-a6bf-94912749d28a","resolution":{"observed_at":"2026-08-07T05:54:15.670114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10579","last_updated":"2023-06-10T21:34:45Z","snapshot_observed_at":"2026-07-06T13:54:53.084096Z","submitted_at":"2022-09-21T18:10:28Z","title":"First-order Policy Optimization for Robust Markov Decision Process","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10579","snapshot_observed_at":"2026-08-07T05:54:11.213481Z","title":"First-order policy optimization for robust markov decision process","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.213481Z"},"links":{"cited_paper":"/paper/2209.10579","citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:d1cc41dc2cedf4e720dcf1ea1362c871a4adb3747d94a44e491221398e5983de","observation_id":"6b2800b2-64ec-4e46-b8c4-4e056478a7aa","resolution":{"observed_at":"2026-08-07T05:54:11.213481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.398425Z","title":"Reinforcement learning in robust markov decision processes","venue":null,"work_id":"bb83c025-89c5-442d-90c9-934905c7e1f0","year":2013},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.344482Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:ebef3277bef346bfec190422daf94b19b44cc1d9c83d947f5061ed4652ec0fd7","observation_id":"1bf65130-af37-4ad7-840a-5349010729bd","resolution":{"observed_at":"2026-08-07T05:54:15.458906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.217571Z","title":"Robustness in markov decision problems with uncertain transition matrices","venue":null,"work_id":"80dde80d-49be-41d8-b833-976b2eb6b499","year":2003},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.492619Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:f051ff0c0519ba8f66bdf4f6c33bd26f62396f584e88e985701079c8031380a0","observation_id":"62b951b7-0427-4e8c-8d7e-707f1a52bc06","resolution":{"observed_at":"2026-08-07T05:54:15.289414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12462","last_updated":"2026-06-21T21:20:26Z","snapshot_observed_at":"2026-08-07T15:43:38.702434Z","submitted_at":"2025-05-18T15:34:45Z","title":"Model-Free Robust Average-Reward Reinforcement Learning with Sample Complexity Analysis","version":3},"cited_work":{"arxiv_id":"2505.12462","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12462","snapshot_observed_at":"2026-08-07T05:54:13.187637Z","title":"Model-Free Robust Average-Reward Reinforcement Learning with Sample Complexity Analysis","venue":"cs.LG","work_id":"23268430-2383-42f9-9f98-616f69786c86","year":2025},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.619397Z"},"links":{"cited_paper":"/paper/2505.12462","citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:45933cc9b3179894f6e9e9de6d5427c54f59d826ecde19427cb707abbbe04837","observation_id":"fccc989e-2617-4fa9-b37f-b38b700b2ac1","resolution":{"observed_at":"2026-08-07T05:54:13.272094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.028330Z","title":"Policy optimization for robust average reward mdps","venue":null,"work_id":"3e88ccb0-02bb-4f75-ade3-20ebb96a05bc","year":2024},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.789338Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:a5ef456ff7af9340f91e859583f3ff13359e0e040a7776e22549be4d32ad850d","observation_id":"71dc82ed-7b97-47dd-8580-1cefb697f5b9","resolution":{"observed_at":"2026-08-07T05:54:15.126484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.855147Z","title":"u nderhauf, Oliver Brock, Walter Scheirer, Raia Hadsell, Dieter Fox, J \\","venue":null,"work_id":"97fe2915-2544-4a67-a39f-9b40e6763f4f","year":2018},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.912786Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:f0787a0f8cd5393e4e9efeb08f9c3f13f5bcf3f9f0a52565d7ab82f792ef8186","observation_id":"d18695a6-251c-4982-8605-2b4a842c01f6","resolution":{"observed_at":"2026-08-07T05:54:14.913558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00603","last_updated":"2022-12-01T15:57:58Z","snapshot_observed_at":"2026-08-10T05:38:46.110405Z","submitted_at":"2022-12-01T15:57:58Z","title":"Near Sample-Optimal Reduction-based Policy Learning for Average Reward MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00603","snapshot_observed_at":"2026-08-07T05:54:11.972128Z","title":"Near sample-optimal reduction-based policy learning for average reward mdp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.972128Z"},"links":{"cited_paper":"/paper/2212.00603","citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:78f297d1d5a785533da657e57d9e7959572959ebe05539b975a3be9c6caaef4b","observation_id":"a5de33fd-8f62-47de-b381-294e48cdd827","resolution":{"observed_at":"2026-08-07T05:54:11.972128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.663699Z","title":"A finite sample complexity bound for distributionally robust q-learning","venue":null,"work_id":"84a6bd62-2b27-4798-907c-237bbed5de30","year":2023},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.041666Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:6c5cb6548f16bb2b9542e1aac6e12daea3d147305914d556540f2201c9527e9a","observation_id":"93319adb-9ce9-47a1-b0a8-f6ca9d1f2e87","resolution":{"observed_at":"2026-08-07T05:54:14.746932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.514064Z","title":"Sample complexity of variance-reduced distributionally robust q-learning","venue":null,"work_id":"6e41e029-da53-41fb-8985-49f6aaaf0f89","year":2024},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.176391Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:c16601cc08e87c9458e0f1ebfb5bd92594773a536f036766b8d6cfd78c1ff7c4","observation_id":"97c97d62-421b-4f4c-ae57-4b937c851a91","resolution":{"observed_at":"2026-08-07T05:54:14.582387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.362081Z","title":"Robust average-reward markov decision processes","venue":null,"work_id":"8350b0d2-c0b9-414f-82c3-bfba177c311b","year":2023},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.288138Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:dd84f16285f7803afa5fe2a06f853212e8690db73ac3c8a18091460e1e9d5a74","observation_id":"734d1291-44f4-4525-afbe-f989b6af7e69","resolution":{"observed_at":"2026-08-07T05:54:14.431435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.171731Z","title":"Robust average-reward reinforcement learning","venue":null,"work_id":"fb92ed4b-5d4e-4d2b-87f0-e2eef8093cf5","year":2024},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.366541Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:92b5687905ef3b0106895c2686d906618095f0a95e2b42277dd86025bad7e685","observation_id":"b1942abc-4d0c-4301-9d6a-10be62db657d","resolution":{"observed_at":"2026-08-07T05:54:14.269153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.008504Z","title":"Model-free robust average-reward reinforcement learning","venue":null,"work_id":"4a693807-25b3-468f-b9c5-6ba47658c656","year":2023},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.439077Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:9f14f031bfa9fee91f859df893907d5f0298a03c66aa360bbc046bec44b99fb9","observation_id":"5e0f1919-a5d5-4225-89fe-f4557761741c","resolution":{"observed_at":"2026-08-07T05:54:14.072906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:13.818353Z","title":"Policy gradient method for robust reinforcement learning","venue":null,"work_id":"5ad1ec2e-3285-4a13-9d0b-bb50076dfa15","year":2022},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.514568Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:a76c4c82dd68a03614be80b943ba0b643030c70dfe93a864a58ac2105e3b5418","observation_id":"126f3854-5a0f-4100-be64-f9c5f82dfeac","resolution":{"observed_at":"2026-08-07T05:54:13.920610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:13.682787Z","title":"Model-free reinforcement learning in infinite-horizon average-reward markov decision processes","venue":null,"work_id":"9f4e3e13-afb4-4561-b93e-94bb3fbd5db4","year":2020},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.593503Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:4a978d82ca956c7e979e0d50ba3f646469c5d718a3c69940fd992794005973f9","observation_id":"06666b7c-fa97-4d1e-8f68-9f7089ee3c9a","resolution":{"observed_at":"2026-08-07T05:54:13.733990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.16816","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:12.974116Z","title":"Finite-sample analysis of policy evaluation for robust average reward reinforcement learning","venue":null,"work_id":"0677bbcc-e545-4e27-ab4b-3e79f8b36ea3","year":2025},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.692896Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:4a2b236c806832100007f567ad48b6fa6b7ffb54bfa3bd6a8c4ef8703d9b0731","observation_id":"8431c331-d2a7-44ed-b314-063e4a2c122d","resolution":{"observed_at":"2026-08-07T05:54:13.058498Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:13.499943Z","title":"Natural actor-critic for robust reinforcement learning with function approximation","venue":null,"work_id":"25dbaae5-7506-48d9-921c-9448ccab4684","year":2024},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.780877Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:54d8efe677f0e2dcc2b7581df4f156ca6f5c3c2f3a650a554a7c6be77bbb6a79","observation_id":"bf156b68-91e8-421d-837f-e06af6c5b5ae","resolution":{"observed_at":"2026-08-07T05:54:13.578820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T05:38:53.966097Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2506.07040."}