{"as_of":"2026-08-11T17:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:916e167bb4de84587d2274154fff8006ac63e374792273eb083b251a9832f2c6","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:04:37.750141Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:56:58.486176Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00160","snapshot_observed_at":"2026-08-03T17:56:58.486176Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.07588","last_updated":"2026-07-17T17:54:02Z","snapshot_observed_at":"2026-08-04T02:40:01.160621Z","submitted_at":"2025-12-08T14:30:25Z","title":"An Agent-Centric Dynamical Systems Perspective on Multi-Agent Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:56:58.486176Z"},"links":{"cited_paper":"/paper/2501.00160","citing_paper":"/paper/2512.07588"},"observation_digest":"sha256:b9694f4f122dc2a3f39eddf1194a7bc779dae5ad8a61099487b261d3bd2903fb","observation_id":"f8fcddfd-3b42-4b8a-b4e6-acceba4a25ad","resolution":{"observed_at":"2026-08-03T17:56:58.486176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00160/citation-record","integrity":"/paper/2501.00160/integrity","json":"/paper/2501.00160/citation-record.json","paper":"/paper/2501.00160"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:39.071358Z","title":"Sutton and Andrew G","venue":null,"work_id":"ab08809e-29ba-4d64-8ba8-98fdd14d50bc","year":2018},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.462734Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:19934f153791cc42ae9ceb99584195ec7e2fea46fc97b579b62648c01d44d063","observation_id":"c82d0212-b734-4ce6-8b5c-1de19bd6988e","resolution":{"observed_at":"2026-08-10T23:04:39.076338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.468039Z","title":"Q-learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.468039Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:9b45ca50ca033af877157c320bb6c35e8f0724c68cbf781f8661549c000afe06","observation_id":"ede5c600-0596-4f40-916d-c7d11cdb3cba","resolution":{"observed_at":"2026-08-10T23:04:37.468039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:39.056273Z","title":"A neural substrate of prediction and reward","venue":null,"work_id":"0f0fd3f4-37ed-445a-a47c-23cefcff7c24","year":1997},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.473285Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:d7e622c24ea56f91395a2bf9bc0d88c2bec0d4974f399b32182b079101996d7d","observation_id":"fb0ee503-4963-4f04-ab85-80a77ddcb118","resolution":{"observed_at":"2026-08-10T23:04:39.060951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:39.040694Z","title":"Reinforcement learning: the good, the bad and the ugly","venue":null,"work_id":"a9ded376-e8e8-4670-b0b8-f081e71b4c0d","year":2008},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.481195Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:96f68613986d048b62626fb1e38070937820d38cd536a53cee8341b285fc0848","observation_id":"2fe1db84-9e11-4071-a921-51e8eccedcf2","resolution":{"observed_at":"2026-08-10T23:04:39.045745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.486353Z","title":"Read Montague","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.486353Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:9bc7526982287cdae36573bb5e8696c03bd417dca3452293b9074b5721a0a05d","observation_id":"069be5b4-5c8c-4d98-8e7a-2872ba4acde2","resolution":{"observed_at":"2026-08-10T23:04:37.486353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-10T23:04:37.491329Z","title":"Playing atari with deep reinforcement learning, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.491329Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:7677a14314b028e557cf6ebd59b0f496de663b181b0f30a8f90e09275c1f7b25","observation_id":"f5710a1e-1e26-4a50-a54d-1c7fcb1720a7","resolution":{"observed_at":"2026-08-10T23:04:37.491329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:39.025432Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"a4f9de06-3980-413b-aad1-b547c810bbc7","year":2015},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.496707Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:c611734aa1da08683c31f07ddd31a17f95adee6c6651624588b3834f827e0ac3","observation_id":"6d0e6ee3-847e-4b95-9d40-4f8a78af7e18","resolution":{"observed_at":"2026-08-10T23:04:39.030325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:39.010595Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":"069f8183-c34b-4e2b-ae6f-7abc52fad95d","year":2016},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.501092Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:b4068c77f8ab0961468581cb763d8be784f877d66519a613c634ef2032ee8d35","observation_id":"87b19751-182e-4e01-bd46-3be7295d6753","resolution":{"observed_at":"2026-08-10T23:04:39.015489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08630","last_updated":"2020-12-15T21:39:50Z","snapshot_observed_at":"2026-08-09T08:09:12.994031Z","submitted_at":"2020-12-15T21:39:50Z","title":"Open Problems in Cooperative AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.08630","snapshot_observed_at":"2026-08-10T23:04:37.505375Z","title":"Open problems in cooperative ai","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.505375Z"},"links":{"cited_paper":"/paper/2012.08630","citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:6268db21071da8a21346d28a55e8778d72caf075eb5ee78f565e616f4b930e58","observation_id":"90890e8b-073a-4732-9a24-9a4103ab86fe","resolution":{"observed_at":"2026-08-10T23:04:37.505375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.996415Z","title":"Cooperative ai: machines must learn to find common ground, 2021","venue":null,"work_id":"d92a4a5c-f3c0-43e0-bef3-6c3a49f73a21","year":2021},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.510300Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:a8dda67fefb87ab81999bc923546dc5b8b91c8e7fd1760f1990b6d2b6c4abf85","observation_id":"2f41f710-0c76-4ef8-8854-f531335c1e30","resolution":{"observed_at":"2026-08-10T23:04:39.000806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.981357Z","title":"Albrecht, Filippos Christianos, and Lukas Sch¨ afer","venue":null,"work_id":"df0c63f8-8c09-4730-b2e7-66c812ba80bf","year":2024},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.514752Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:89d345c740e372eb27688b3dc1665722a57a0058fc8bf377d5828979cd5c14ec","observation_id":"d0490090-1490-4591-8b81-8c9391b46e1e","resolution":{"observed_at":"2026-08-10T23:04:38.985918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.966659Z","title":"Multi-agent reinforcement learning: independent vs","venue":null,"work_id":"331018a8-500f-42ca-ac20-9a9d222b327b","year":1997},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.519210Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:8884119726abc1844fbb540c0f4ef92f4b5fb7b356a09885bf2d039cadce835a","observation_id":"66e493d2-750a-4f41-8a3f-b583ca55f98b","resolution":{"observed_at":"2026-08-10T23:04:38.971316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.09183","last_updated":"2019-03-11T20:17:29Z","snapshot_observed_at":"2026-07-06T05:53:08.086224Z","submitted_at":"2017-07-28T10:49:41Z","title":"A Survey of Learning in Multiagent Environments: Dealing with Non-Stationarity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.09183","snapshot_observed_at":"2026-08-10T23:04:37.523950Z","title":"A survey of learning in multiagent environments: Dealing with non-stationarity","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.523950Z"},"links":{"cited_paper":"/paper/1707.09183","citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:4d1089a31a112aff5467b37db79e670c0ad7ec455b9056ef4b27e181f13d6b34","observation_id":"074fdb90-989e-4979-9108-594560fbbae3","resolution":{"observed_at":"2026-08-10T23:04:37.523950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.950317Z","title":"Independent reinforcement learners in cooperative markov games: a survey regarding coordination problems","venue":null,"work_id":"a4cfde91-8615-4091-9997-4ddd9acb5c7c","year":2012},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.528783Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:446fa0866dd47843c1635545087dce5f6a2d4a7c6369faf2016930b11baf436b","observation_id":"5927b641-37e8-4527-a776-0eb37471a74f","resolution":{"observed_at":"2026-08-10T23:04:38.956202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.935255Z","title":"A survey and critique of multiagent deep reinforcement learning","venue":null,"work_id":"3d3a0d55-627a-4511-a72a-2bc0df433dfa","year":null},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.533148Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:e891367ee4db075b2f06b0a725d2cb61e32643e51a5e53e92bd8c066f0a8740a","observation_id":"888d0c23-4265-4fc3-9858-4795c1980cd8","resolution":{"observed_at":"2026-08-10T23:04:38.940143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07869","last_updated":"2021-11-09T10:42:04Z","snapshot_observed_at":"2026-08-09T21:21:10.717989Z","submitted_at":"2020-06-14T11:22:53Z","title":"Benchmarking Multi-Agent Deep Reinforcement Learning Algorithms in Cooperative Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07869","snapshot_observed_at":"2026-08-10T23:04:37.538087Z","title":"Benchmark- ing multi-agent deep reinforcement learning algorithms in cooperative tasks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.538087Z"},"links":{"cited_paper":"/paper/2006.07869","citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:1dd45687f1738fea440936198dd4e0e151917dd945b0ec4326ddfba315fc3891","observation_id":"431129d0-3e96-4b6d-aeea-44cd422c9dfd","resolution":{"observed_at":"2026-08-10T23:04:37.538087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1997.2319","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.342546Z","title":"Learning through reinforcement and replicator dynam- ics","venue":null,"work_id":"1b531620-69b0-43e2-9037-b760b83f221d","year":1997},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.543004Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:858314d31fbe9ec6427b8d19214ad15f9d3ed3c3c1377048e442e228610fab54","observation_id":"0687e0cd-9be0-450a-bcb2-dda5084f9e2d","resolution":{"observed_at":"2026-08-10T23:04:38.350491Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.920646Z","title":"A selection-mutation model for q-learning in multi-agent systems","venue":null,"work_id":"1b62b6f2-9e82-48de-8465-5659b67f4886","year":null},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.547413Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:27cc4ab8a05d298457e93bd168eef3a686fa5cc911d5460ed5ae8287c0ba1dcf","observation_id":"755cd89e-5898-46fc-b5c3-189ffc5fdf46","resolution":{"observed_at":"2026-08-10T23:04:38.925545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.556134Z","title":"Doyne Farmer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.556134Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:66cb2f202dcd409ce61b4f99227ba4bcb1a3b867ca03223094205431de021088","observation_id":"e0a297b2-13ba-4172-a790-f3315cba42ae","resolution":{"observed_at":"2026-08-10T23:04:37.556134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.560867Z","title":"Crutchfield","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.560867Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:cd0477975381ff37c4164264ec5f2e34fcf64c41ebbe86bdcadb2b220a3a47ff","observation_id":"05adf438-9b55-4cb9-8e4a-8826f82021a7","resolution":{"observed_at":"2026-08-10T23:04:37.560867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.904682Z","title":"Crutchfield","venue":null,"work_id":"0c0d9e04-ec4b-45a2-8235-00a8a3227e7e","year":2005},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.565691Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:36d918babfc95003e02523fe8e1ac278dcadf3b79502738387e7e6f6d391bc94","observation_id":"608361af-33bd-4ec0-ab50-0325dfeb9be6","resolution":{"observed_at":"2026-08-10T23:04:38.910090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.890425Z","title":"Individual q-learning in normal form games","venue":null,"work_id":"239138d3-b10d-441a-af9d-9426f1ed9094","year":2005},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.574579Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:539e9cd20458b44732618589e5aa783c0e50fda4ae043dc1ee6a0e665a02598c","observation_id":"818a8dbe-0bb5-4302-9f5a-d6726841646b","resolution":{"observed_at":"2026-08-10T23:04:38.894600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.876926Z","title":"Reinforcement learning dynamics in social dilemmas","venue":null,"work_id":"d8e23ab4-cb15-4685-9960-2e6d4ceea9fc","year":null},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.579301Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:9acc14ff085471a306b9f40374befcebaf465b81af8bce2812e262974d2091a9","observation_id":"7c5e8bd7-72b2-4ec2-b3fb-f4fd290f5608","resolution":{"observed_at":"2026-08-10T23:04:38.881520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.862315Z","title":"Learning and equilibrium","venue":null,"work_id":"16119e35-a665-4f7e-b264-e478635238c6","year":2009},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.583929Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:d56bb75f1194ad9d0c560436a685c361875e4203351f343099413f1d54f940ab","observation_id":"eb3d957f-51e8-4d4a-88f3-1209bb6600f9","resolution":{"observed_at":"2026-08-10T23:04:38.867165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.846450Z","title":"Intrinsic noise in game dynamical learning","venue":null,"work_id":"d28d29e4-4933-4591-b8ab-52132a2fa391","year":null},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.588353Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:d9bc6a53c5199013532b2e806e9d35ccc2eb6f8ee8c37a26d1c80b0ae2e6ded9","observation_id":"53a100fc-dd1d-4a89-8e68-6773734a60c6","resolution":{"observed_at":"2026-08-10T23:04:38.851549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.830365Z","title":"A theoretical analysis of temporal difference learning in the iterated prisoner’s dilemma game","venue":null,"work_id":"05331313-7465-4fd3-a2b0-b2bb2abad509","year":2009},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.598200Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:fa23546c432605e2a7e46a77a771ca2c8d1121c021eb5568e8ffc13e9304a3d1","observation_id":"66a06a5b-048b-4f66-a589-3eb444863253","resolution":{"observed_at":"2026-08-10T23:04:38.835719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.815126Z","title":"Classes of multiagent q-learning dynamics with epsilon-greedy exploration","venue":null,"work_id":"eebfcc61-a447-4d35-ac16-34d14c9c5cc6","year":2010},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.602787Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:1d05174332929dff90bda94844ce4d715fa950028d8239ea129aa27b655ae366","observation_id":"d596418a-fa44-4095-b7e4-b2ac82b9d517","resolution":{"observed_at":"2026-08-10T23:04:38.820001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.799966Z","title":"Numerical analysis of a reinforcement learning model with the dynamic aspiration level in the iterated prisoner’s dilemma","venue":null,"work_id":"0b45b4cd-4878-4000-a770-70b29830e08d","year":2011},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.607193Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:70e63d9a4d8c5c0866da984a7c748383dd8dc373ffa84d38d9e2b0b8a2da3ad6","observation_id":"a1b6a395-0b89-4a1e-bb55-6b32f1bdfa33","resolution":{"observed_at":"2026-08-10T23:04:38.805147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.611648Z","title":"Cycles of cooperation and defection in imperfect learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.611648Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:e0201b9136e8dac7b7bdb9904ef493653cae71421f784683148d7aa606915083","observation_id":"7dbba3b5-f465-4bde-8d67-01301685e1b5","resolution":{"observed_at":"2026-08-10T23:04:37.611648Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1103/physreve.85.041145","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.861084Z","title":"Dynamics of boltzmann q learning in two-player two-action games","venue":null,"work_id":"fd5e4059-fbe2-466c-ae59-c8a7fa52b4e0","year":2012},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.616159Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:2b5afd12f3a065ba959167bae42797555e8efd4d78f3edeaca94a9d00e9b3e3e","observation_id":"f1953e47-2139-4c63-bb1c-109378b2a46e","resolution":{"observed_at":"2026-08-10T23:04:37.865856Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.785775Z","title":"Continuous strategy replicator dynamics for multi-agent q-learning","venue":null,"work_id":"c4e3c3c2-9cd1-41d5-981b-16331296f50a","year":2013},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.620816Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:9678ec4e0eab942965c096e6683645923c1f0a937aea691a07494324eef39d22","observation_id":"6c92b88c-3c2f-4dde-9e7b-347a99363090","resolution":{"observed_at":"2026-08-10T23:04:38.790443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.625483Z","title":"Doyne Farmer","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.625483Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:7f0bbdb2177c9a332d01b5571f33f8d7df4468b56bd5309494dedd94a64e3ae6","observation_id":"c6866ed2-8ffd-48fc-b9ab-ea5b82e58334","resolution":{"observed_at":"2026-08-10T23:04:37.625483Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.771893Z","title":"Evolutionary dynamics of multi-agent learning: A survey","venue":null,"work_id":"ad533236-cf92-4235-9c8d-ecd0ec8cea95","year":2015},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.630631Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:7f34e175c860e30598535623199afaaaaec2ee33d2db5eb86ed8e103903b7a68","observation_id":"32690eba-1bac-4a08-8285-be07bfd8d0ea","resolution":{"observed_at":"2026-08-10T23:04:38.776330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.635376Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.635376Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:f853c9bfbae4f97857d03e2577f61b27830d61e13bd7dc59f6c669179a0d8aac","observation_id":"c8f3080a-3b9c-44d5-8592-53aca54a9702","resolution":{"observed_at":"2026-08-10T23:04:37.635376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1103/physreve.99.043305","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.826363Z","title":"Donges, and J¨ urgen Kurths","venue":null,"work_id":"66050992-135d-4b63-8e54-94f1b5687cee","year":2019},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.640348Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:fbe24894d88618d09a341b4177cc1e3057bcee0432ffdef29c0e97cbcf3bf89a","observation_id":"0b931376-2dbd-4507-9242-c7bdc6a05b25","resolution":{"observed_at":"2026-08-10T23:04:37.830920Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.758563Z","title":"Modelling the dynamics of multiagent q-learning in repeated symmetric games: a mean field theoretic approach","venue":null,"work_id":"2b5fa69c-7d46-4351-87aa-0b98cdb8f810","year":2019},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.644820Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:e715cd832a78180e468f5caeb88b12b616e6bf3fbc5926c3e1c45bd291093255","observation_id":"bc80f7e8-be7f-49e0-80b8-70a8c21ad044","resolution":{"observed_at":"2026-08-10T23:04:38.762892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00521-021-06117-0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.810040Z","title":"Dynamical systems as a level of cognitive analysis of multi-agent learning","venue":null,"work_id":"96597a61-f118-4326-a7eb-f22d49ed3b6d","year":2022},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.649221Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:f9f7a830d20bd08494f5fea7c9edf58f1444c34b7298a5bea6f39a37b03d6d9b","observation_id":"d170359c-ecde-4b7a-b828-3f5ba27c1ee3","resolution":{"observed_at":"2026-08-10T23:04:37.816019Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01500","last_updated":"2022-03-03T03:22:38Z","snapshot_observed_at":"2026-08-10T16:14:54.058462Z","submitted_at":"2022-03-03T03:22:38Z","title":"The Dynamics of Q-learning in Population Games: a Physics-Inspired Continuity Equation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01500","snapshot_observed_at":"2026-08-10T23:04:37.653856Z","title":"The dynamics of q- learning in population games: A physics-inspired continuity equation model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.653856Z"},"links":{"cited_paper":"/paper/2203.01500","citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:efcf32372c228fee598e07e20fecf9d0bb132f703ce04fcbfae033d0f7993e24","observation_id":"d5c323d6-1f11-4456-b750-81e19428dd89","resolution":{"observed_at":"2026-08-10T23:04:37.653856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.744750Z","title":"A formal model for multiagent q-learning dynamics on regular graphs","venue":null,"work_id":"e25000ab-cd03-401f-8c23-33029441e4f8","year":2022},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.658248Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:16217637a79a90cafde484a5a642bee8dd0508c48fb0c725ca5364817c9f1b13","observation_id":"464b5458-f6ed-43d9-a852-0e76a6dc80f2","resolution":{"observed_at":"2026-08-10T23:04:38.748897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.729840Z","title":"Modeling the effects of environmental and perceptual uncertainty using deterministic reinforcement learning dynamics with partial observability","venue":null,"work_id":"4b6417c2-6912-4243-abe4-d3e1ea2329ea","year":2022},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.662675Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:68cbc23d43814c0ec1aaea7308cca9b37043f552db44f5cdfb666e933b9fc96a","observation_id":"83891b36-205b-4e5b-8b72-46159c69cfd1","resolution":{"observed_at":"2026-08-10T23:04:38.734983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.714012Z","title":"Exploration-exploitation in multi-agent learning: Catastrophe theory meets game theory","venue":null,"work_id":"84d70384-e57e-41ff-b68b-7bfb4382feeb","year":2022},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.666984Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:ead44536978be88c450453ffd2dfddcf4a12f84496ec3ee5e8f0905b6fc92781","observation_id":"ae5d1519-d53c-4637-a811-f02ce349dffd","resolution":{"observed_at":"2026-08-10T23:04:38.718840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.698787Z","title":"Frequency adjusted multi-agent q-learning","venue":null,"work_id":"b55b5484-d85a-41a3-9ce0-35c36be67364","year":2010},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.670922Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:f85dfd1eb549c43b37ba0f0ed7cb3529dbd9a73a607daec5fac4c6c1c56d7cb9","observation_id":"b204136b-54d9-4b1b-bf93-c084026b2a45","resolution":{"observed_at":"2026-08-10T23:04:38.703830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10459","last_updated":"2024-11-01T19:46:08Z","snapshot_observed_at":"2026-08-08T06:12:26.666193Z","submitted_at":"2024-11-01T19:46:08Z","title":"Evolutionary Multi-agent Reinforcement Learning in Group Social Dilemmas","version":1},"cited_work":{"arxiv_id":"2411.10459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10459","snapshot_observed_at":"2026-08-10T23:04:38.152387Z","title":"Evolutionary Multi-agent Reinforcement Learning in Group Social Dilemmas","venue":"cs.MA","work_id":"fdb70a04-f530-4b9b-9afe-569fbb10d84a","year":2024},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.675296Z"},"links":{"cited_paper":"/paper/2411.10459","citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:7696c1b68b2cd8f965b7f4d2953ccb750bd447309187d6fc5c79053079a5eae5","observation_id":"dde5802c-95a4-4165-9a28-757e77cfda30","resolution":{"observed_at":"2026-08-10T23:04:38.157481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"pii/0303264","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.126146Z","title":"Sandholm and Robert H","venue":null,"work_id":"3167842e-67e1-4127-86e0-cb503f66fb14","year":1996},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.680420Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:82515743b4e7f70b451988517dd8c3ebeefcaae1ed13ef5b99105e81342bbb22","observation_id":"007617c1-8e8b-4f8c-ab5a-06becd7747ec","resolution":{"observed_at":"2026-08-10T23:04:38.136190Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.684060Z","title":"Faq-learning in matrix games: Demonstrating convergence near nash equilibria, and bifurcation of attractors in the battle of sexes","venue":null,"work_id":"3f9a4f5e-13c1-49d8-a249-d2e3b17db718","year":2011},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.684780Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:9ea8a152ac0ef9036700504e4440d5c13884fc0b686f2926c7d0991d053bc607","observation_id":"ba7a4dca-6d42-4315-b8ab-b6ca5c79b24e","resolution":{"observed_at":"2026-08-10T23:04:38.689075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.668637Z","title":"L´ evy noise promotes cooperation in the prisoner’s dilemma game with reinforcement learning","venue":null,"work_id":"d2ff1f1a-90a6-4184-93b1-a76b3aac1a13","year":2022},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.689137Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:cf22b6c775803097edb4936283ab22e87eab725e0abc93f9472162a26b97f560","observation_id":"cf2886f0-3d29-4440-84c1-78048f471843","resolution":{"observed_at":"2026-08-10T23:04:38.673951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.653971Z","title":"Limiting dynamics for q-learning with memory one in symmetric two-player, two-action games","venue":null,"work_id":"ef46622e-b3ab-438e-9276-baef7d78cb94","year":2022},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.693543Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:0c3c667c28c090e126312eec471a920067d1b6802a848950236fef3df60213bc","observation_id":"da0760aa-9940-4be1-b097-a0450dcfaa2c","resolution":{"observed_at":"2026-08-10T23:04:38.658704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2312.08484","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.031924Z","title":"Q-learners can provably collude in the iterated prisoner’s dilemma","venue":null,"work_id":"c0b597f9-c0c4-4a9a-ada6-0dc547c1864f","year":2023},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.698125Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:7943eebf592c04f3b77adb6aa2d0f36adc9ffc66990d8b5471506c56bf420d9f","observation_id":"2c497bf0-d8f4-45a3-b1dd-2ed07bd7b9fc","resolution":{"observed_at":"2026-08-10T23:04:38.040057Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.638863Z","title":"Symmetric equilibrium of multi-agent reinforcement learning in repeated prisoner’s dilemma","venue":null,"work_id":"c3c3f6b4-f871-4162-bd93-6a8749000660","year":2021},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.702473Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:cfe724a3d998794337acb456561b2e623bf14b0372f1a5f33c4a53e9a93b27c1","observation_id":"87679894-bb4d-4df0-be0a-d0ff9041c445","resolution":{"observed_at":"2026-08-10T23:04:38.643861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.622480Z","title":"Q-learning in two-player two-action games","venue":null,"work_id":"fc64f21b-1cb5-457b-9d2a-762cacc71130","year":2009},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.707053Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:193ec3ca9122f311c55bb2593ae2cceaa63db82cc9c6bfbe57307dc2bccbe2b9","observation_id":"7f307846-458d-4acd-9eab-b0e27043a061","resolution":{"observed_at":"2026-08-10T23:04:38.627730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.607204Z","title":"Melioration learning in iterated public goods games: The impact of exploratory noise","venue":null,"work_id":"ec6304f1-6357-415b-99b4-d7a3a6ff9c30","year":2018},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.711573Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:ec0e4ab31684718e2f94665a28354464d90b0ac3771d4ecab3784ebb9344f734","observation_id":"af5294dc-6586-4fa4-bb30-47d8b12cac0a","resolution":{"observed_at":"2026-08-10T23:04:38.612357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.590449Z","title":"Rein- forcement learning and decision making in monkeys during a competitive game","venue":null,"work_id":"3b2564b8-4623-4b99-aeaf-083a4d908491","year":2004},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.715929Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:5cd7dce65076c7c1b91e11ac092db51c96be61c9d983c998e6a6c5a229b63bf1","observation_id":"6dcea1a7-2004-4da3-8d4d-1e2f3c91b413","resolution":{"observed_at":"2026-08-10T23:04:38.595972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.574245Z","title":"Valuation of uncertain and delayed rewards in primate prefrontal cortex","venue":null,"work_id":"cd0c639c-7d67-44ff-9139-67a7ebecd235","year":2009},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.720573Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:39852ff1bcdfa2031b99911b7e8c7635c1af00c2dd56afa7a1a5aa040cc080cb","observation_id":"b524ab3f-a1ab-4c81-a39a-8e307a7893e1","resolution":{"observed_at":"2026-08-10T23:04:38.578784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/1882186","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.792657Z","title":null,"venue":null,"work_id":"f5956801-a0ac-475e-9499-4af589d9f0ae","year":1973},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.725633Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:9a73bab52ee225bc188f955337c2c8e2acdb8e31a5f6fe87dcb1d8de85b39514","observation_id":"b408edeb-f28f-4075-a9c9-697d34c90c7e","resolution":{"observed_at":"2026-08-10T23:04:37.798611Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.730146Z","title":"Batch Reinforcement Learning, pages 45–73","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.730146Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:e96815df5847a0d3c39db4227cf996f7b5c6f57e27a0a17e5608aabb011f3273","observation_id":"4420efb1-5bf7-463b-983d-58b89ed118c1","resolution":{"observed_at":"2026-08-10T23:04:37.730146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.559491Z","title":"Quantal response equilibria for normal form games","venue":null,"work_id":"b4a250d4-b1f9-4c8e-a52a-daa8e8e45a68","year":1995},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.735267Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:00e50ec35e524b7357883dbf8d1a364c8751b34bbd37ca5093f50cf17a0f33cc","observation_id":"d390adb9-6282-47e6-955c-0976dca97129","resolution":{"observed_at":"2026-08-10T23:04:38.564275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.543860Z","title":"High-stakes failures of backward induction","venue":null,"work_id":"bd41fcf2-d30d-4f39-bf30-4dec6bafc1e9","year":2024},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.740001Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:8252bee3caf84c55e2606b1d2aa8c8730ecdb78818bfb24dd80d89f42697fac3","observation_id":"b01182b5-d586-484e-8dfb-5fefa770ff00","resolution":{"observed_at":"2026-08-10T23:04:38.549040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.528606Z","title":"Timing of transients: quantifying reaching times and transient behavior in complex systems","venue":null,"work_id":"989712d6-5636-45a5-9d29-0707e46343b6","year":2017},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.744647Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:59089edadbc58ae436ef08963f35b8222ead14651b2e214433cee2714ca65516","observation_id":"00597c54-f9fb-4af8-8538-a57afa102217","resolution":{"observed_at":"2026-08-10T23:04:38.533809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.512201Z","title":null,"venue":null,"work_id":"c8e78ddf-2742-4cc1-a98a-473d2557504e","year":2023},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.750141Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:6776331db95d4b9bdaf04041a5bf9d32eff11327e04dbb187a87bd9270cb761a","observation_id":"334dd36e-5558-4080-b6d5-f283cc63ff50","resolution":{"observed_at":"2026-08-10T23:04:38.517277Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0575.86068","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:38.262253Z","title":"ISBN 1581136838","venue":null,"work_id":"531476db-8fd7-4fcd-8536-195da55a098a","year":null},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.552134Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:2b18b7d38b4febf8f4e811cda62e13c3a28b3cb8510081a2a5c8ff588b23ff46","observation_id":"f480cf6d-f0b7-465a-b8ee-bc4823072742","resolution":{"observed_at":"2026-08-10T23:04:38.269857Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1103/physrevlett.103.198702","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.885366Z","title":"URL https://link.aps.org/doi/10.1103/ PhysRevLett.103.198702","venue":null,"work_id":"25dfae5d-cc5f-46a0-8523-8fc3f2a2c527","year":null},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.592510Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:c42c2ad2b7735b73f28c2c50a623abcdd32cb62ba7c69fb0015d38bfa39697a4","observation_id":"302cb385-d681-445d-a95a-a63c593f0215","resolution":{"observed_at":"2026-08-10T23:04:37.889657Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.physd.2005.06.031","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:04:37.899673Z","title":"URL http://dx.doi.org/10.1016/j.physd.2005","venue":null,"work_id":"2dc5b047-1b01-4e76-ac96-2854f03cc8f1","year":2005},"citing_paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations","version":1},"reference_index":2789,"source":"pdf_text","source_observed_at":"2026-08-10T23:04:37.570146Z"},"links":{"citing_paper":"/paper/2501.00160"},"observation_digest":"sha256:09ae4908d595032a8a400b7b1e136f606ad611577dd6542017ae976efd689788","observation_id":"56916ade-5a51-445c-a2c6-1b176da410fa","resolution":{"observed_at":"2026-08-10T23:04:37.903873Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00160","last_updated":"2024-12-30T22:12:09Z","latest_version":1,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-10T22:55:40.830079Z","submitted_at":"2024-12-30T22:12:09Z","title":"Deterministic Model of Incremental Multi-Agent Boltzmann Q-Learning: Transient Cooperation, Metastability, and Oscillations"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":10,"verified_fuzzy":37},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2501.00160."}