{"as_of":"2026-08-20T07:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e648f8b72dd72dc96d7faebd5180773ce2062d4241d7d1fe1aa9067bb1a79eb2","coverage":[{"denominator":152,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:06:35.668035Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12753/citation-record","integrity":"/paper/2608.12753/integrity","json":"/paper/2608.12753/citation-record.json","paper":"/paper/2608.12753"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.195886Z","title":"2020 , publisher=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.195886Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:4ede62dada3a55b8a4a8b6070a63247583263fc40eb0034a411bbf9d20b78939","observation_id":"badda87a-aa63-496b-9f84-9aafbe6eebd0","resolution":{"observed_at":"2026-08-16T00:06:35.195886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.201329Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.201329Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:18726650ccb17e876479882d43970cd167f695aa594f8c9da11a4c5f480709c0","observation_id":"5306fead-73ee-4bbb-9836-8da0e6eae3ed","resolution":{"observed_at":"2026-08-16T00:06:35.201329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.206002Z","title":"2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.206002Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:828400e355b517cc9cc9677f1551cc688a662eba15337a4a991d11426b968430","observation_id":"6f6b76eb-73f5-4848-925b-7342b910b81a","resolution":{"observed_at":"2026-08-16T00:06:35.206002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.210594Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.210594Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:cd2118426a875659badf7e6ff0968e9a1122d80a9494758704278760f0807533","observation_id":"707b6eab-8dee-4737-a9ff-744d2a693dd5","resolution":{"observed_at":"2026-08-16T00:06:35.210594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.215165Z","title":"IEEE Transactions on Automatic Control , volume=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.215165Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e5aa89e8acb2aaf0fda8f486e7d348dec00fc6cff701ef769fcaec6d00b06fe1","observation_id":"d535b898-f8c5-406d-8085-798a1ef61a3c","resolution":{"observed_at":"2026-08-16T00:06:35.215165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.219876Z","title":"Annals of Applied Probability , pages=","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.219876Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:611b08347d432cd331239f4341e2d7f9dc707dd97b539b88a6e8cdd11f82b651","observation_id":"8c4c3dcc-b6b8-4b2d-adb4-405e3c434fb0","resolution":{"observed_at":"2026-08-16T00:06:35.219876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.224484Z","title":"Advances in applied mathematics , volume=","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.224484Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:ad658c30e961257281987e8bf0181bcd6dbb9b985bdced8d31ec749658e3b08a","observation_id":"1c8e814f-3996-423b-9b46-7c16c68a5e4f","resolution":{"observed_at":"2026-08-16T00:06:35.224484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.229401Z","title":"IEEE Transactions on Information Theory , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.229401Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:b7b29bcaac76f99743ba89d98fc966fbdb9f91c95cf29ed6421cf4010bff0ebf","observation_id":"2dd27044-3bfa-40c4-b012-382670731fcf","resolution":{"observed_at":"2026-08-16T00:06:35.229401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.234671Z","title":"1988 , institution=","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.234671Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:7dc73b9531a5bbffb40d8e9d13795c61e877743481415c8e34cbdb02e9e43d9c","observation_id":"82ffb743-3e94-4b97-8726-e3ced01282f1","resolution":{"observed_at":"2026-08-16T00:06:35.234671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.239161Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.239161Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:0853ef928f0e2bfb0cd742eb1e8999f6e55fd54cf20bb119cc451ec9c0f57e87","observation_id":"0518c517-c4b2-4fdc-b89f-de353cd14230","resolution":{"observed_at":"2026-08-16T00:06:35.239161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.243913Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.243913Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:9f02639a7d1df315e86e5ca8fc2c909125af6884711845ba3ccf8c744ac32a9a","observation_id":"314e6fcf-b4d0-41ac-a67c-7fb9328dabf8","resolution":{"observed_at":"2026-08-16T00:06:35.243913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.248403Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.248403Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:937c8e3edcc3f0f5a14c7d27a0fb36d1bb7fa7fe48630a3bb3b09f9ecfc59f6e","observation_id":"7014bc98-3b68-4e80-b261-9bb54713a667","resolution":{"observed_at":"2026-08-16T00:06:35.248403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.253365Z","title":"IEEE Journal of Selected Topics in Signal Processing , volume=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.253365Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:70875c7bb0ed67e0e06b76b8861f714fb20923e5e595546a049ab199405a7d20","observation_id":"c3c683be-3bef-4d67-9a35-33743b21a744","resolution":{"observed_at":"2026-08-16T00:06:35.253365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.257900Z","title":"Joint European Conference on Machine Learning and Knowledge Discovery in Databases , pages=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.257900Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:b8cc0ee98a6721aba715ca2694196df797cebb254a3112a1181094d79ab196ec","observation_id":"ff196522-0fef-4d4c-bb44-74297161a60b","resolution":{"observed_at":"2026-08-16T00:06:35.257900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.262437Z","title":"IEEE Transactions on Wireless Communications , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.262437Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:574d88154015bb3779713edd9fac9de1925497dc32dbb009151ee753c1733d1c","observation_id":"3f282eec-ee42-4f13-9913-212c2ac6df18","resolution":{"observed_at":"2026-08-16T00:06:35.262437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.266918Z","title":"Algorithmic Learning Theory , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.266918Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:5c5ccf865fbfb1c210ce2e6c2ac9a4bce6a66dade0918abf6de5e4ba79abe57e","observation_id":"9c53a552-c104-455c-88a8-ac0ca3b985fa","resolution":{"observed_at":"2026-08-16T00:06:35.266918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.271433Z","title":"2011 , publisher=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.271433Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:dfdb2e2c6354bef3fc98e25ca82ee2dac4106718d21c1fc55e3e658cf54a8d7e","observation_id":"b48c356d-a80d-4c14-a11d-00883f5874bb","resolution":{"observed_at":"2026-08-16T00:06:35.271433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.275830Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.275830Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:0bc645c7adef351c1fbaae8b8a845f820d863d9511342dea4d08f09397dc7b97","observation_id":"c01e68e2-99f3-4673-ae5e-946956698f00","resolution":{"observed_at":"2026-08-16T00:06:35.275830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.280426Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.280426Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:f8db78bc98ff2e6fd883c4133b825f9b5f084f9eb98304fde7c359246d8509df","observation_id":"909e423d-3606-4e6a-b242-45d93f94088b","resolution":{"observed_at":"2026-08-16T00:06:35.280426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.285565Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.285565Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:7c1f32a4a107687bc71d6f8a27c29fc4f725d24170d471a42cf1479abf4ea662","observation_id":"4d9d90ea-30b4-485b-ae2d-3acaf06dec85","resolution":{"observed_at":"2026-08-16T00:06:35.285565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.290130Z","title":"IEEE Transactions on Signal Processing , volume=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.290130Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:abe92a0f1ea5ed7bf6d853228f0ce6133b292af8a2b8964f0b661668169780c9","observation_id":"f3bbaa03-ad88-425c-a6f6-7eb239548e8f","resolution":{"observed_at":"2026-08-16T00:06:35.290130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.294419Z","title":"IEEE Journal on Selected Areas in Communications , volume=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.294419Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:539692089af12614cc05bd2749b562f5208be55dfdc003e75d304c433d761891","observation_id":"efff38e7-ae50-41ac-9516-4da11d7a41dd","resolution":{"observed_at":"2026-08-16T00:06:35.294419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.298854Z","title":"IEEE Transactions on Control of Network Systems , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.298854Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:f42c9827ad7fd71c675b112e1370125cfefca562903c85e5425df0de1e01cb83","observation_id":"7dd5d52f-08af-4517-a0f5-28ffbd0a7de5","resolution":{"observed_at":"2026-08-16T00:06:35.298854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.303356Z","title":"IEEE/ACM Transactions on Networking , volume=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.303356Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:afb4a4cd6616411183f83a9d91750315336a83aed66697989e20bf4acb184d61","observation_id":"1def6370-f6c6-4315-a29e-d7f49cce9860","resolution":{"observed_at":"2026-08-16T00:06:35.303356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.308017Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.308017Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:3f206b570f67ea4c57bac06396349f480e1313c87f2d2bc75d73b510ad4d6626","observation_id":"068423d8-f86f-46f6-94d1-8896ba6f7a5a","resolution":{"observed_at":"2026-08-16T00:06:35.308017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.312467Z","title":"American Economic Review , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.312467Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:4ab06a5b7c555cf5110c7349d94a3e832f55a46d9234833563f4eba4243cda25","observation_id":"4d8e7701-a2f6-40be-bb14-00e19bf3ec7c","resolution":{"observed_at":"2026-08-16T00:06:35.312467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.317264Z","title":"Journal of Economic Theory , volume=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.317264Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:50198c1380e99718d784b2a91008c639fb519235ec8ec6e39aaf56bfcf7f9d7b","observation_id":"f1f679d1-0ff4-433d-ad73-87b1acfb4e14","resolution":{"observed_at":"2026-08-16T00:06:35.317264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.321887Z","title":"Econometrica , volume=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.321887Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:0a35e21af9d330fe2ae62540b0d0787c8ea5db65069acc96a22c9f2549769480","observation_id":"1f7ba88b-9f9e-4932-9e50-a7555348c089","resolution":{"observed_at":"2026-08-16T00:06:35.321887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.326647Z","title":"Economics essays , pages=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.326647Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:72c54c062293c5905042835a9c0dc28e73a44434f678a86e3e7baf891293f99c","observation_id":"97c9355f-a7b6-4641-805b-58be34154d8d","resolution":{"observed_at":"2026-08-16T00:06:35.326647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.331166Z","title":"2013 , publisher=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.331166Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:500cf41f4387246d8176507fc86f2169ba7e5201a4cfa7b196cf63a55d16c158","observation_id":"86c43e78-5941-4d9a-8160-593033c6f5eb","resolution":{"observed_at":"2026-08-16T00:06:35.331166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.335547Z","title":"1998 , publisher=","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.335547Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:270ecd3fc77589da93756c7f796dd04264038c9f8b4c728f74b5571523a53521","observation_id":"dba8408e-1038-4c32-bc08-a90159818fe8","resolution":{"observed_at":"2026-08-16T00:06:35.335547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.340343Z","title":"2006 , publisher=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.340343Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e37aecfa189fdeedfdfcf29e8ecfcbcacabd48c8c444906c9fe8e8361dbbb902","observation_id":"6114b205-6737-4d36-85c9-341f810b0781","resolution":{"observed_at":"2026-08-16T00:06:35.340343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.345550Z","title":"2004 , publisher=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.345550Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:0bd5d0b743d639d8452993c5ce94add2c6142d35b80b6bbd920bd780792ce1d5","observation_id":"6b7356fb-e1fe-4eac-8315-af31f0a75555","resolution":{"observed_at":"2026-08-16T00:06:35.345550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.350519Z","title":"Management science , volume=","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.350519Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:dbdd6eff250814ab0a0a5afd496d1adabfe165581571e9d2d0ddc38e8549dbbb","observation_id":"5816420e-176e-46f9-a932-23303ae6e65e","resolution":{"observed_at":"2026-08-16T00:06:35.350519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.355040Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.355040Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:a27609ad9ec4360032da88c86d870c73404115ad0d4ab0be12231ff3f214e1f7","observation_id":"8188a948-d023-4449-bddf-9d0b1c211457","resolution":{"observed_at":"2026-08-16T00:06:35.355040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.360108Z","title":"IEEE Transactions on Signal Processing , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.360108Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:4c33d68ffff7c9e3c8f36b0862cb184cd6fe3614ca0bbfffd4bd13ad64d2ece8","observation_id":"798ebf40-19dd-489b-b132-3d59b8ade1fe","resolution":{"observed_at":"2026-08-16T00:06:35.360108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04468","last_updated":"2019-10-24T13:19:01Z","snapshot_observed_at":"2026-08-14T18:16:49.394746Z","submitted_at":"2018-10-10T11:46:20Z","title":"Decentralized Cooperative Stochastic Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04468","snapshot_observed_at":"2026-08-16T00:06:35.364938Z","title":"arXiv preprint arXiv:1810.04468 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.364938Z"},"links":{"cited_paper":"/paper/1810.04468","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:0f4d1b9b6c69a5c263508ec072c9d763657f3db54613ea5241aa96ce69e14eba","observation_id":"3d05d1fe-8d96-436c-bbc3-1c46d457afdc","resolution":{"observed_at":"2026-08-16T00:06:35.364938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.370579Z","title":"2019 IEEE 60th Annual Symposium on Foundations of Computer Science (FOCS) , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.370579Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:036398074a5cde8cbe17b2e31968e5b54903f3602931b8008d682764e7e1f264","observation_id":"341efd43-e1dc-4c73-a96f-b84c554aba57","resolution":{"observed_at":"2026-08-16T00:06:35.370579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.375552Z","title":"2020 IEEE 61st Annual Symposium on Foundations of Computer Science (FOCS) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.375552Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:8bb5bf374d3102b2c21f98f6a25d82221507d14caa997316be83fbfc69447eb3","observation_id":"56108f52-f084-44a7-8ad6-48d8f1986d55","resolution":{"observed_at":"2026-08-16T00:06:35.375552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.380570Z","title":"IEEE Journal on Selected Areas in Information Theory , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.380570Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:6c7685c88e1dfcd8e9d7b260ec5bec64612f64851bf4479151b928f6ef4cd84f","observation_id":"bea023b5-fb85-496b-99b8-86f55d548b24","resolution":{"observed_at":"2026-08-16T00:06:35.380570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03818","last_updated":"2021-09-07T18:18:58Z","snapshot_observed_at":"2026-08-16T17:58:14.759316Z","submitted_at":"2021-09-07T18:18:58Z","title":"Online Learning for Cooperative Multi-Player Multi-Armed Bandits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.03818","snapshot_observed_at":"2026-08-16T00:06:35.385808Z","title":"arXiv preprint arXiv:2109.03818 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.385808Z"},"links":{"cited_paper":"/paper/2109.03818","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:22d7507e0e3a68bd35219962f32e69228581c3ae57f5473e27daffc73980373e","observation_id":"169bb85b-f715-4ed6-9f71-f912737d1132","resolution":{"observed_at":"2026-08-16T00:06:35.385808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.390931Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.390931Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:44c11b0c30a17686489354f31d46ab5c346e82bb9dd1f175e6f0da44798dad09","observation_id":"e57b4ce3-f770-4dd2-bbc2-cae5b9ba229f","resolution":{"observed_at":"2026-08-16T00:06:35.390931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.396758Z","title":"Conference on Learning Theory , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.396758Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:30fd45c7fce77756cf4ee6965bc7d5973e0675d330c56c1c645a528510efe187","observation_id":"5962df21-5d2d-4fad-a5da-0157aeca2daa","resolution":{"observed_at":"2026-08-16T00:06:35.396758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06210","last_updated":"2023-11-10T17:55:44Z","snapshot_observed_at":"2026-08-17T18:34:33.921452Z","submitted_at":"2023-11-10T17:55:44Z","title":"Optimal Cooperative Multiplayer Learning Bandits with Noisy Rewards and No Communication","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06210","snapshot_observed_at":"2026-08-16T00:06:35.401617Z","title":"arXiv preprint arXiv:2311.06210 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.401617Z"},"links":{"cited_paper":"/paper/2311.06210","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:a9759995630bffd9de3bbadececb1f105c951633280da573ad8e4361bfa11f65","observation_id":"9e5c7185-99ba-44e1-8684-5d060dfbaf9c","resolution":{"observed_at":"2026-08-16T00:06:35.401617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.407550Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.407550Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:c54264ea966f5cbe262fe335463a5d75ffc38a049a576cf5643df91971710cb8","observation_id":"7e119872-59a6-4962-ae3b-19377aaeb859","resolution":{"observed_at":"2026-08-16T00:06:35.407550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.412623Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.412623Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:71ff9831cb7133fb64ad59a9051c4f4f7507457b8349016484d641ca43db6279","observation_id":"dad003c7-d494-4a0b-be54-44402aae77b1","resolution":{"observed_at":"2026-08-16T00:06:35.412623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.417604Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.417604Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:50024ad0455dac8fa23c280c460539ef77088c986c8e51c2ff1feeefc88292a5","observation_id":"baa843f6-92af-4744-8999-c40b5f536a90","resolution":{"observed_at":"2026-08-16T00:06:35.417604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.423079Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.423079Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d0059ef594669d5faa1d5a75706e29ece10d5fc450441672996db1fe75673c53","observation_id":"14557dea-7ffe-495d-b53e-c82f88d0b4c6","resolution":{"observed_at":"2026-08-16T00:06:35.423079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.428732Z","title":"Algorithmic Learning Theory , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.428732Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:5846380509ed893d3984ee5b0f9c86b701529e81b00e3f16e32b4b1c545f5387","observation_id":"395e5a95-383b-4fc2-acf5-874fec679aae","resolution":{"observed_at":"2026-08-16T00:06:35.428732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.433285Z","title":"IEEE Transactions on Automatic Control , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.433285Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:6015d4b145e3d5a78f9356bfb948392e1a20fb9e471fd74499f5c2ff02908e90","observation_id":"379770b4-0d06-4da4-bbb5-ea94ca5f2cbc","resolution":{"observed_at":"2026-08-16T00:06:35.433285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.438034Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.438034Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:3ab469f76bf66512de046c413d218dc2592502e5bab744110692ab8d2478362b","observation_id":"9f0dcace-cef0-4495-9a6a-cb4e68f752b7","resolution":{"observed_at":"2026-08-16T00:06:35.438034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.442710Z","title":"2017 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.442710Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:1011ec1b1c12583707c2804c942422cacc72d9e1b946280ec8990fa2541a559c","observation_id":"67bd8f59-8814-43cd-8d5c-493dd478f390","resolution":{"observed_at":"2026-08-16T00:06:35.442710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.447726Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.447726Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:41ec897cea91953dbac3e1d48fc54c804b15a64081227bdba6feb24156cc9de8","observation_id":"903f5a5a-1390-4bd8-94bc-1121c60a6956","resolution":{"observed_at":"2026-08-16T00:06:35.447726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.452531Z","title":"arXiv preprint arXiv:2502.16387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.452531Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:0015945e6c8fa0bf990298c803d10c36c02ea45109c9a992aa868f96a064448a","observation_id":"78c1e34b-bbbe-4cc1-b12f-4f93875196d8","resolution":{"observed_at":"2026-08-16T00:06:35.452531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17625","last_updated":"2025-02-24T20:20:06Z","snapshot_observed_at":"2026-08-18T17:12:54.511997Z","submitted_at":"2025-02-24T20:20:06Z","title":"Instance-Dependent Regret Bounds for Learning Two-Player Zero-Sum Games with Bandit Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17625","snapshot_observed_at":"2026-08-16T00:06:35.457448Z","title":"arXiv preprint arXiv:2502.17625 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.457448Z"},"links":{"cited_paper":"/paper/2502.17625","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:6bf59ffc9fb28fd11a2077e92444a4393d79c7c036de3bebf68fd6d77bb0666b","observation_id":"a5b7a6fa-ae09-471d-b6e5-d7896b1e8a3d","resolution":{"observed_at":"2026-08-16T00:06:35.457448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02825","last_updated":"2025-03-04T17:49:24Z","snapshot_observed_at":"2026-08-16T12:53:07.536820Z","submitted_at":"2025-03-04T17:49:24Z","title":"On Separation Between Best-Iterate, Random-Iterate, and Last-Iterate Convergence of Learning in Games","version":1},"cited_work":{"arxiv_id":"2503.02825","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.02825","snapshot_observed_at":"2026-08-16T00:06:36.220563Z","title":"On Separation Between Best-Iterate, Random-Iterate, and Last-Iterate Convergence of Learning in Games","venue":"cs.LG","work_id":"fd34f232-cd0f-401d-a6f6-69fca95b028d","year":2025},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.462593Z"},"links":{"cited_paper":"/paper/2503.02825","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:224afd7e4387e506e94e90ba342450bd660e388d860cfa689e47168521cbf329","observation_id":"1f23b533-8fda-4f35-bfbd-3f2ee0b2cdaa","resolution":{"observed_at":"2026-08-16T00:06:36.227275Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12529","last_updated":"2025-06-18T16:11:36Z","snapshot_observed_at":"2026-08-19T19:39:41.791349Z","submitted_at":"2025-02-18T04:32:52Z","title":"Alternating Regret for Online Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12529","snapshot_observed_at":"2026-08-16T00:06:35.467512Z","title":"arXiv preprint arXiv:2502.12529 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.467512Z"},"links":{"cited_paper":"/paper/2502.12529","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:f3a905e189b8c3f8e67783bdf52312f8e31dedac4b9a5a6bc7741d3129e281c2","observation_id":"5dcc6597-4e72-4197-9811-8d3ca080daee","resolution":{"observed_at":"2026-08-16T00:06:35.467512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.472555Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.472555Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:30bf190618f7c72486fe5c2ec26c54bd3b9fc4191a3e9ad6b078d2153f2d85c7","observation_id":"1bded3ff-37c6-4eae-ab45-181093ac2bf3","resolution":{"observed_at":"2026-08-16T00:06:35.472555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12528","last_updated":"2025-02-20T01:16:02Z","snapshot_observed_at":"2026-08-16T12:57:28.471722Z","submitted_at":"2025-02-18T04:32:51Z","title":"Contextual Linear Bandits with Delay as Payoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12528","snapshot_observed_at":"2026-08-16T00:06:35.477335Z","title":"arXiv preprint arXiv:2502.12528 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.477335Z"},"links":{"cited_paper":"/paper/2502.12528","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:16d6d5666fe6b47199db7493547a7e0a8ac5dcfad914fae92515f7221731cf9d","observation_id":"5422f714-5292-4c8c-8c5f-90e667f0d117","resolution":{"observed_at":"2026-08-16T00:06:35.477335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07120","last_updated":"2025-02-16T19:18:39Z","snapshot_observed_at":"2026-08-15T11:06:18.184638Z","submitted_at":"2024-12-10T02:23:44Z","title":"Corrupted Learning Dynamics in Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07120","snapshot_observed_at":"2026-08-16T00:06:35.482262Z","title":"arXiv preprint arXiv:2412.07120 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.482262Z"},"links":{"cited_paper":"/paper/2412.07120","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:4df6b162ba203a2d77cc7daba27d88c206fb4ce993f198e7385bbc3cdc38cfa9","observation_id":"4169f2de-cbab-4ec7-be4c-bb9a02ba21ad","resolution":{"observed_at":"2026-08-16T00:06:35.482262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.487604Z","title":"The Thirty Sixth Annual Conference on Learning Theory , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.487604Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:f984ff489db753d3f16d65a994225cfa54bdd0f5696a4eb6bcae128eaa95266e","observation_id":"cb454c1e-e73f-4811-a991-b5b96c404de1","resolution":{"observed_at":"2026-08-16T00:06:35.487604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07637","last_updated":"2024-05-14T08:10:15Z","snapshot_observed_at":"2026-08-19T15:32:12.448263Z","submitted_at":"2024-05-13T10:51:01Z","title":"Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07637","snapshot_observed_at":"2026-08-16T00:06:35.491992Z","title":"arXiv preprint arXiv:2405.07637 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.491992Z"},"links":{"cited_paper":"/paper/2405.07637","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:5c3f591d39cabcaff4adba516b376bbf8026b1093e294b808e65ee5d58e903f1","observation_id":"b049526e-fcdc-4347-9ce8-1a1841ba4193","resolution":{"observed_at":"2026-08-16T00:06:35.491992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.496598Z","title":"Algorithmic Learning Theory , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.496598Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:b4be78f1be281d9237ecaa061a402af9dbf90804f4ca333750a33516ee48d9fb","observation_id":"f602e061-3d64-4f3e-9b19-ab1b163e166c","resolution":{"observed_at":"2026-08-16T00:06:35.496598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.03295","last_updated":"2016-10-11T12:09:03Z","snapshot_observed_at":"2026-08-18T17:24:51.927515Z","submitted_at":"2016-10-11T12:09:03Z","title":"Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.03295","snapshot_observed_at":"2026-08-16T00:06:35.501573Z","title":"arXiv preprint arXiv:1610.03295 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.501573Z"},"links":{"cited_paper":"/paper/1610.03295","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:bccafed147d819ba68da3f8ebe72f038da1bd3e2a6a36ab1d73e3b5d5de57c06","observation_id":"84671e26-f77c-4319-80b2-80f91e55b7a4","resolution":{"observed_at":"2026-08-16T00:06:35.501573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.506755Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.506755Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:6ce2c918cce41af0601ce392b1463f020746c01da8c405621409cb79495e7842","observation_id":"b15c2a2e-c510-4e7f-8fe3-fbdf9e09ade8","resolution":{"observed_at":"2026-08-16T00:06:35.506755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.511301Z","title":"nature , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.511301Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:58b4815a2c2097d49c97e479eacffe51e9f65dd8ee17992952f8999b6b4d8fcc","observation_id":"2dc8295c-eac4-463d-90b5-8c7fee912941","resolution":{"observed_at":"2026-08-16T00:06:35.511301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.515696Z","title":"nature , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.515696Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:084480281aedae95adf858910d4679a66510de0b19ec9c4995713992677c2457","observation_id":"97e4dbca-55f8-455e-8b14-d0a7b13ce43c","resolution":{"observed_at":"2026-08-16T00:06:35.515696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.520510Z","title":"The International Journal of Robotics Research , volume=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.520510Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:c44b5408d26b42166a630d2bd3f454683759dcbe5f23fc6228d164afbd7f7e9e","observation_id":"3b9a6b78-7e68-48a7-9762-ae2693906b21","resolution":{"observed_at":"2026-08-16T00:06:35.520510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-16T00:06:35.525391Z","title":"arXiv preprint arXiv:1509.02971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.525391Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:961bafb090173f185259d2a14ecb923ff9725611f01f19951dbba4becc9f7239","observation_id":"dd82304b-5eaf-48a9-a670-cc8be2f742a6","resolution":{"observed_at":"2026-08-16T00:06:35.525391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.530528Z","title":"Science , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.530528Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:b8bfec3565163197be927020c495a680c19c37d666058148c53a56e010cc0d73","observation_id":"b53d6174-9846-4571-91da-faff8ea9ac3b","resolution":{"observed_at":"2026-08-16T00:06:35.530528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.535494Z","title":"nature , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.535494Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:780ce411bf6a85fe80acd4a66f4f87b6c43da37eac179b8e193e1ef9bf3c3b0d","observation_id":"088888d1-a8d7-4f9c-a952-acc388cf86b6","resolution":{"observed_at":"2026-08-16T00:06:35.535494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.540261Z","title":"IEEE Transactions on Systems, Man, and Cybernetics, Part C (Applications and Reviews) , volume=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.540261Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:b3149f794046250acc61026daa93d9e59f5a282013d6cd08e644ffd1071a3597","observation_id":"6d07789a-ef41-42c3-9406-28fa48332474","resolution":{"observed_at":"2026-08-16T00:06:35.540261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.545138Z","title":"Transportation Research Part C: Emerging Technologies , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.545138Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:14421e13b56fd0afe6ddd7be1c839c8344cd52832f9a8cbf53962e99dccdbf01","observation_id":"8348ff8d-1795-4211-b64e-e99196d7ed65","resolution":{"observed_at":"2026-08-16T00:06:35.545138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.549734Z","title":"Computer networks , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.549734Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:098596344b084c7aebb4ec1cc3de6a5408d7ddeb816394405f40364061a3f00f","observation_id":"5562bc88-939c-4335-9364-d6bc97e8dba5","resolution":{"observed_at":"2026-08-16T00:06:35.549734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.554276Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.554276Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:2a7fb9134a7849563db8e7b10eb42a85e51cb1e2eb5bf8b1948eb2e7ec4be171","observation_id":"443e4fe6-7125-4635-b885-620b4bed17ca","resolution":{"observed_at":"2026-08-16T00:06:35.554276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.559153Z","title":"IEEE Transactions on Systems, Man, and Cybernetics-Part A: Systems and Humans , volume=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.559153Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d5d29e68a1adc7978016361ea810ffe4393b35f072988d858725adb0cc695eef","observation_id":"5a6880a7-26b3-46d2-9948-586283b8cd44","resolution":{"observed_at":"2026-08-16T00:06:35.559153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.564114Z","title":"IEEE Transactions on robotics and Automation , volume=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.564114Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:989846600e9a7fca0c5bd1912bc9b8745677b8dcfc1a02b3d0733c48dfc221fe","observation_id":"d3ed634a-f6af-4f0a-bf00-519e89158f8f","resolution":{"observed_at":"2026-08-16T00:06:35.564114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.568346Z","title":"Automatica , volume=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.568346Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d4e2766a4a4674f6fe7c0862d619106c7c32773aae893db92e3cd30c3a84746c","observation_id":"2f085ab2-3838-4aef-b473-8a6a8a243fe8","resolution":{"observed_at":"2026-08-16T00:06:35.568346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.572907Z","title":"Cognitive Systems Research , volume=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.572907Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:a057b062b81e42d5d2231bae9483c938d0372e070a789b8b8243d097367437ae","observation_id":"c1d18032-65d3-4941-859e-29fc146e32e5","resolution":{"observed_at":"2026-08-16T00:06:35.572907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.03037","last_updated":"2017-02-10T01:48:40Z","snapshot_observed_at":"2026-08-17T00:56:32.664514Z","submitted_at":"2017-02-10T01:48:40Z","title":"Multi-agent Reinforcement Learning in Sequential Social Dilemmas","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.03037","snapshot_observed_at":"2026-08-16T00:06:35.577420Z","title":"arXiv preprint arXiv:1702.03037 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.577420Z"},"links":{"cited_paper":"/paper/1702.03037","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:8c9a9448b2f9ad84b4bf11179fc775ae8401fedd4ca6ff60860dd5d6fabdbc9a","observation_id":"5c215af9-b8d6-4c60-ad90-7f1f6c77c190","resolution":{"observed_at":"2026-08-16T00:06:35.577420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.582493Z","title":"TARK , volume=","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.582493Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:0d3ba241dd901426b1983d2a2dd1ed4ce1e2826142a12928e282c01725576b4c","observation_id":"c834d973-a31f-4c9a-80d8-c4537793becf","resolution":{"observed_at":"2026-08-16T00:06:35.582493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.586997Z","title":"IEEE Transactions on Automatic Control , volume=","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.586997Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:eddf6fd692b331778958b67b81c728b3af4b1e2177f425ffbdd83b8687335ef8","observation_id":"18e6ed14-dd52-4bcb-b6d7-4c487a50b4a8","resolution":{"observed_at":"2026-08-16T00:06:35.586997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.591517Z","title":"Proceedings of the IEEE , volume=","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.591517Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:a9f850341ddf020bb14505674aa3852bfaa9f8b27bc826d6710ebd45061e0dd7","observation_id":"05f2b152-17ae-433c-920d-9232f4f6c460","resolution":{"observed_at":"2026-08-16T00:06:35.591517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.596200Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.596200Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:aa2fb36da4ba8cbf81f60edd8eaeab313504e2130cda526017dbafd3a6d7b05a","observation_id":"cc28cb0f-ca1f-46d7-a818-f76dcc1dfd04","resolution":{"observed_at":"2026-08-16T00:06:35.596200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.600638Z","title":"2008 , publisher=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.600638Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:19373ba9d493c663e5657222dc346897b644bda87b857c2948c81a15c9afb072","observation_id":"eae2e29b-b1a3-44a6-b659-df1d5905aec2","resolution":{"observed_at":"2026-08-16T00:06:35.600638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.335076Z","title":"2013 , publisher=","venue":null,"work_id":"d0223082-15de-44fe-b341-d53e799d345e","year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.605234Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:814741abea4f615264ef206ad333e1edec8d240d0533f5f386837318db077b47","observation_id":"b787d9f8-cb4c-4971-bf86-ed1e0570fc9d","resolution":{"observed_at":"2026-08-16T00:06:37.339488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.00899","last_updated":"2018-05-22T11:23:55Z","snapshot_observed_at":"2026-08-14T19:49:22.503760Z","submitted_at":"2018-02-03T02:56:54Z","title":"Learning Parametric Closed-Loop Policies for Markov Potential Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.00899","snapshot_observed_at":"2026-08-16T00:06:35.609869Z","title":"arXiv preprint arXiv:1802.00899 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.609869Z"},"links":{"cited_paper":"/paper/1802.00899","citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:659b9f2af49053bec5b8644d047e83a23a2b522e113c86a01d0ce3d273f95325","observation_id":"367536a7-7fb8-43e1-844d-68401a11f4bf","resolution":{"observed_at":"2026-08-16T00:06:35.609869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.317987Z","title":"IEEE Transactions on Signal Processing , volume=","venue":null,"work_id":"2e119183-3cdb-43a2-843b-67e5802ddff8","year":2016},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.614692Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:59b91c5d77261dae2fa91fcec2ece54c76f392084d52a071f38789a8ca222f2f","observation_id":"3022df4d-592a-4c7b-8e6c-025dc0303014","resolution":{"observed_at":"2026-08-16T00:06:37.322747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.302582Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"34dc286f-9689-4225-9f3e-f94ffc2544ef","year":2018},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.619854Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:a5bb875e248bf7ef49db6344b966abe71f07af959387dfd08f405907fd723a58","observation_id":"87919b18-d553-49a4-90fc-6db8637b29ce","resolution":{"observed_at":"2026-08-16T00:06:37.307228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.199514Z","title":"IEEE Transactions on Signal Processing , volume=","venue":null,"work_id":"c2bad1f6-7c61-4152-942e-ab08a675dfe0","year":2013},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.624249Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:eb44767672e62153f0ac7adb4a4daf0d2b72671ca8fb498050871ecc08fc38ca","observation_id":"578eaf5a-070e-497b-99b4-b808f4f6be68","resolution":{"observed_at":"2026-08-16T00:06:37.246711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.184991Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"48c2fac1-5fed-45c0-979a-1eb7a797ecd7","year":2019},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.628571Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:3d9c1ed648e1c210c0ab9e7dbc8cfce754a30d06e60523bb655008018dc81786","observation_id":"83223d6a-cea6-4f3e-bce5-672ee564da42","resolution":{"observed_at":"2026-08-16T00:06:37.189613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.169442Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"5f1d58f4-124e-4616-8b7c-66ee81ff7da8","year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.633095Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:7e035b935f342bd63239f67efce4f517994e65be8125936eff1174602a8a7484","observation_id":"f34b193f-3dbb-4a69-a683-bccfe36d4a89","resolution":{"observed_at":"2026-08-16T00:06:37.174083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.637333Z","title":"Machine learning proceedings 1994 , pages=","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.637333Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:ba8b5a9478f7d14779652c783daf0b129c3955ea2bd01dec5600c579fa83696e","observation_id":"649b881d-164b-45d7-9cde-dab55de65587","resolution":{"observed_at":"2026-08-16T00:06:35.637333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.143842Z","title":"IEEE Transactions on Automatic control , volume=","venue":null,"work_id":"f6609a83-d844-48c3-9397-6e77a86f6cb5","year":2003},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.641496Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:ac9568ffe6497801b4b4feb5ce6c04e4784d1fff56d92d64ce454646675918ef","observation_id":"802249ee-6387-42e6-877e-6541772bc021","resolution":{"observed_at":"2026-08-16T00:06:37.148651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.129762Z","title":"2008 , publisher=","venue":null,"work_id":"5fb53e62-9104-46e3-99bd-2495ff29754f","year":2008},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.645877Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d92b68b6afe2b205dd4f43cdc8e68e54b7ed5fac68ddad77b540601c7d77a7c5","observation_id":"9370ee92-0194-4d3e-acbb-236614ec5fbe","resolution":{"observed_at":"2026-08-16T00:06:37.134097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.114425Z","title":"Learning for Dynamics and Control , pages=","venue":null,"work_id":"7e054f2c-9373-4307-a529-8a52c9b7fc70","year":2020},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.650479Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:ca472ca5c14dd740a058670304a22098a38ce1cc4f59628561dc82889a0ddd60","observation_id":"3c279b31-47c6-42a2-9808-18ecc5b47267","resolution":{"observed_at":"2026-08-16T00:06:37.119344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:35.655042Z","title":"Journal of machine learning research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.655042Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:e0afcc9b195ba97e8b32fdea35ecc7b352d4090c4660062640bed4e537bfb041","observation_id":"490b0cdb-7d83-42da-89fc-5903e5a3cd4a","resolution":{"observed_at":"2026-08-16T00:06:35.655042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.085032Z","title":"ICML , volume=","venue":null,"work_id":"097b6a8e-53d2-4986-adda-047c54c48201","year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.659359Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:be9294aed4e4e1aa36557489caed2379a529efec56620260f645b46f7a07697c","observation_id":"99f6bc8b-feda-4adf-8fef-20c1fb9cb088","resolution":{"observed_at":"2026-08-16T00:06:37.089874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.069377Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5227b62c-e6d1-4ed1-95ed-c2985c52159c","year":null},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.663661Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:f7386d03162fe22c4193e0d7c191b9e8ffe0fbe0d34804d3f067246012b9074b","observation_id":"1efa6af2-3c5d-42ec-8f74-e972f98097a4","resolution":{"observed_at":"2026-08-16T00:06:37.073827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:06:37.053982Z","title":"IEEE Transactions on Automatic Control , volume=","venue":null,"work_id":"e125fd45-eeab-4b24-8ea2-909141e34430","year":2021},"citing_paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-16T00:06:35.668035Z"},"links":{"citing_paper":"/paper/2608.12753"},"observation_digest":"sha256:d7c281ab369a15164b39bdcaaa24742d35c993b1d3f0fef65117a13defed4d5c","observation_id":"746a5953-c470-4a59-846d-6654f26cbf1a","resolution":{"observed_at":"2026-08-16T00:06:37.058983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.12753","last_updated":"2026-08-13T03:06:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T04:57:13.784858Z","submitted_at":"2026-08-13T03:06:11Z","title":"Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":87,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":152},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 152 outbound references and 0 inbound Pith citation observations for arXiv:2608.12753."}