{"as_of":"2026-08-21T06:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40fb579c6edf58c6284ad67e080c2da170d6b712d76d06e56f502b15715f5de0","coverage":[{"denominator":149,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:18:10.339798Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.15495/citation-record","integrity":"/paper/2501.15495/integrity","json":"/paper/2501.15495/citation-record.json","paper":"/paper/2501.15495"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:09.999335Z","title":"Demand-responsive zone gen- eration for real-time vehicle rebalancing in ride-sharing fleets,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:09.999335Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:e1e73d22844510e25decb2181f4d31f6df58889d830dae939b015ff438f3d25c","observation_id":"6a0c98c5-4272-4917-9f29-3f9642cc3c71","resolution":{"observed_at":"2026-08-10T14:18:09.999335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.004039Z","title":"Demand-responsive rebalancing zone generation for reinforcement learning- based on-demand mobility,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.004039Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:abb27cf80846f2b27ffceceea6ca73899fa531c856ced35bb31cd578c64dc4c9","observation_id":"e08fbf5b-0bb2-4536-9d86-880b282c53f1","resolution":{"observed_at":"2026-08-10T14:18:10.004039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.007734Z","title":"Multi-agent transfer learning in reinforcement learning- based ride-sharing systems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.007734Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:791f94bf1e2c68a334e4993198837d21a6ca06037378cb77fdc6b6bf37b8e9b6","observation_id":"1c91acdd-cd75-4442-aca9-e614cb4e6460","resolution":{"observed_at":"2026-08-10T14:18:10.007734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.011564Z","title":"Expert-free online transfer learning in multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.011564Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:54a760c77910bd31d68ee5ab85910b74f3b0423abeea24a7948e58434b4fdeeb","observation_id":"ed892fcf-3dd8-499d-a059-05db882c5408","resolution":{"observed_at":"2026-08-10T14:18:10.011564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.014946Z","title":"Continual model-based reinforcement learning for data efficient wireless network optimisation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.014946Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:63b3658d546481355365f048ea09368050f393ca0a64a092a499c0375eeeda97","observation_id":"ed181d69-4862-4cbe-8430-ebf776832198","resolution":{"observed_at":"2026-08-10T14:18:10.014946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.018373Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.018373Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:d2eb764cb0c0f0f3d3c14c2488efd2d17e5264040285ea1117aba7254a46d59e","observation_id":"42a5eb0c-710c-4cce-9ed1-90a873b8adfa","resolution":{"observed_at":"2026-08-10T14:18:10.018373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T14:18:10.021792Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.021792Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:4295bac5d8d9f5fd0acf41fafa35bbac33bbc6c4acae3e8fdb3a3e7999ad5c67","observation_id":"699949c4-b5e6-4cab-9eb5-e7141d8134e8","resolution":{"observed_at":"2026-08-10T14:18:10.021792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.04143","last_updated":"2024-05-03T15:00:50Z","snapshot_observed_at":"2026-08-14T22:23:10.894196Z","submitted_at":"2015-11-13T02:34:33Z","title":"Deep Reinforcement Learning in Parameterized Action Space","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.04143","snapshot_observed_at":"2026-08-10T14:18:10.025780Z","title":"Deep reinforcement learning in parameterized action space,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.025780Z"},"links":{"cited_paper":"/paper/1511.04143","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:2386d5bb7f997ea8b56c1abba4f89c0cc6b677c8b973c6a03eed4d58a4d7db25","observation_id":"9a3321a5-b8ff-4b77-8e96-fe4914d99042","resolution":{"observed_at":"2026-08-10T14:18:10.025780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.029837Z","title":"Tlc trip record data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.029837Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:1552b9c6f236bad17ff285863c41932a8d1517d3ff0a3adf5b7501edc513be7c","observation_id":"1404a28c-05b9-46df-b685-a3120fda79a7","resolution":{"observed_at":"2026-08-10T14:18:10.029837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.033070Z","title":"Openai gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.033070Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:c320ed8b30330478a47f9bdecbbf80336d4b7e0ca4339456050d395ee3e65be8","observation_id":"9b7baca7-726e-49ca-b1e7-77bf1ae47448","resolution":{"observed_at":"2026-08-10T14:18:10.033070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.036361Z","title":"Sim-to-real transfer in deep reinforce- ment learning for robotics: a survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.036361Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a65ee7543b6a8a181366e0f2fde1bb21a2a6c4f8834008bef03c595e09fa60ad","observation_id":"3f8a866c-f9d0-4665-b9f3-9b96d2845368","resolution":{"observed_at":"2026-08-10T14:18:10.036361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.039678Z","title":"Reinforcement learning in robotics: A survey,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.039678Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:41f00e09efe61c16c6e7cef91435a53662ec15483df6d202da5189786ad53f6a","observation_id":"325a389a-7522-402c-bbc4-7f93fc5e7b98","resolution":{"observed_at":"2026-08-10T14:18:10.039678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.042876Z","title":"Survey of model-based reinforcement learning: Applications on robotics,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.042876Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:141f350e05130437ab0229ff65605cf43ac80424074d835ac457d9bc3cbce6b3","observation_id":"00634596-fd90-4c1f-a808-ba84026b13e7","resolution":{"observed_at":"2026-08-10T14:18:10.042876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.046245Z","title":"Reinforcement learning in economics and finance,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.046245Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:d672a0774492654c65decd029a5115685a9ad8657f884d41a040839467562ab2","observation_id":"f5bf0e7e-a2b0-433d-8201-85d1b352febf","resolution":{"observed_at":"2026-08-10T14:18:10.046245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.049478Z","title":"Recent advances in reinforcement learning in finance,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.049478Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:fbd587ed00fbd221792bae60abdf43a899ce7420b5491f6e386ce4dc08725489","observation_id":"ec0fbc76-a09a-4657-b82c-02917fb352eb","resolution":{"observed_at":"2026-08-10T14:18:10.049478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.052720Z","title":"Multi-agent reinforcement learning for traffic light con- trol,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.052720Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:c653121e0a2d39fcf1006c8c63b2c6d655f15f4fec5bda9c1ee92e83f0a5ecf9","observation_id":"6f7c6211-26f0-44d2-bb5c-25cdd4670594","resolution":{"observed_at":"2026-08-10T14:18:10.052720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.056348Z","title":"Recent advances in reinforcement learning for traffic signal control: A survey of models and evaluation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.056348Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:e48991dd9e3efa2477d848048f40fd4531886810dc6e5d52d9707b465959b24e","observation_id":"f5f0a958-8318-4ac7-880c-6ff2a4542e22","resolution":{"observed_at":"2026-08-10T14:18:10.056348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.059578Z","title":"Shared autonomous mobilityondemand: Alearning-basedapproachanditsperformanceinthepresenceof traffic congestion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.059578Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:e0b548b98c7ce743f342608e4a72dccdce6b1a0c932e6f1193d755b487cc7f77","observation_id":"da76614e-62cd-430d-9efd-712ef8288328","resolution":{"observed_at":"2026-08-10T14:18:10.059578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.062746Z","title":"Deep reinforce- ment learning for mobile 5g and beyond: Fundamentals, applications, and challenges,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.062746Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:bb768973071ab7f3b137f4abcb80ede5c492cfaae06c7e621769e2ad47ae26ad","observation_id":"607a52bd-4bb7-4829-89ba-48ff3f4a628f","resolution":{"observed_at":"2026-08-10T14:18:10.062746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.065959Z","title":"Rl-nsb: Reinforcement learning- based 5g network slice broker,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.065959Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:4a1226158158f49888c772e0fe881ede67a7cab18e0784292771a661c077af9a","observation_id":"efc6a627-ba19-40ca-b6e5-d314dd220ffb","resolution":{"observed_at":"2026-08-10T14:18:10.065959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.069159Z","title":"Deep reinforcement learning in medical imaging: A literature review,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.069159Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:1f5939216419f2636313e1d0deedf756baac448b0c5da6d0c41e936a6de529b5","observation_id":"54c51b7d-eadc-4f4c-bd0c-cd5ade43350c","resolution":{"observed_at":"2026-08-10T14:18:10.069159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.072273Z","title":"Reinforcement learning for intelligent healthcare applications: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.072273Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:89cb68719465b2f32249fc9458f5d860260eb09828c9b1a004c8fa29ec9df247","observation_id":"7731bab4-5f35-48dd-8fcc-db6051f3f337","resolution":{"observed_at":"2026-08-10T14:18:10.072273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.075404Z","title":"Deep reinforcement learning in medicine,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.075404Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:9008f923b5414cd537de39d94e40e16d46581f3d3330d2de7fb68e9ee4d260c2","observation_id":"fb4eae29-253f-467b-9cd2-14bf125f4da7","resolution":{"observed_at":"2026-08-10T14:18:10.075404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.078598Z","title":"Literature survey of statistical, deep and reinforce- ment learning in natural language processing,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.078598Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:671a7e8286c2114130bfd00612255bce6bebaab5b44db192461f2b1bf447d1a4","observation_id":"00d5f02e-1f89-4fbf-b24c-a7fe99857fa0","resolution":{"observed_at":"2026-08-10T14:18:10.078598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.081902Z","title":"Survey on reinforcement learning for language processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.081902Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:59f34b5bbc3e1cac3914a5426b62a0eb91f9fe5e25c4c41caabbe5447fe32123","observation_id":"b56a1663-d4b9-473f-b4dd-060f24014161","resolution":{"observed_at":"2026-08-10T14:18:10.081902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04671","last_updated":"2022-10-22T14:34:44Z","snapshot_observed_at":"2026-08-16T23:40:37.342111Z","submitted_at":"2016-06-15T08:20:51Z","title":"Progressive Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.04671","snapshot_observed_at":"2026-08-10T14:18:10.084938Z","title":"Progressive neural networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.084938Z"},"links":{"cited_paper":"/paper/1606.04671","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:77d739b07f7def40f8b8df670fa404810cfe36da94b98a3fe666e8490e76e213","observation_id":"45c8a8b5-7834-426e-bc5a-2db24b507267","resolution":{"observed_at":"2026-08-10T14:18:10.084938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.088247Z","title":"Progress & compress: A scalable framework for continual learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.088247Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:dbe782a25d9ee94fe68ad5bb19b7a1a0c56dc4ac3070a725b7f1028a8faf08a1","observation_id":"8fbe1167-f782-474b-9db2-1b348360e9f4","resolution":{"observed_at":"2026-08-10T14:18:10.088247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.091854Z","title":"Deep reinforcement learning with knowledge transfer for online rides order dispatching,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.091854Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a399bc11d58697b8f186a5abd66791651e1cee82c194eefa849076bed746a7d5","observation_id":"22733a5b-f1e7-4de0-a4c5-7fb80d48e2fc","resolution":{"observed_at":"2026-08-10T14:18:10.091854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.094972Z","title":"Sharing knowledge in multi-task deep reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.094972Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:51ed152918ec8ab99d81479ea2adf295750bb8c1c57891fdb24f50ea4d885b89","observation_id":"197ef505-c48a-4419-aaa2-c0edd8ae7404","resolution":{"observed_at":"2026-08-10T14:18:10.094972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.098273Z","title":"Learning modular neural network policies for multi-task and multi-robot transfer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.098273Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:92d1ee536cdeedff3dfd05e0eea980c8dcd19189db77a35534b3baecc4da117e","observation_id":"031c4951-11b4-4f91-a05a-fa74f6f12826","resolution":{"observed_at":"2026-08-10T14:18:10.098273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.02396","last_updated":"2016-06-08T04:48:49Z","snapshot_observed_at":"2026-08-14T21:53:45.014617Z","submitted_at":"2016-06-08T04:48:49Z","title":"Deep Successor Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.02396","snapshot_observed_at":"2026-08-10T14:18:10.101303Z","title":"Deep successor reinforce- ment learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.101303Z"},"links":{"cited_paper":"/paper/1606.02396","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:2cb431bbde2b420694e2f44cdec725cb69ce5cb65f570073ab12714079363c2c","observation_id":"9e1fcd72-d4b6-435c-ae00-9a15dcb03276","resolution":{"observed_at":"2026-08-10T14:18:10.101303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.105545Z","title":"Overcoming cata- strophic forgetting in neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.105545Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:dfaf9020ef8923fe6acba23b0db2cf0f91e25ced9923d4567c6f6f7d658c35c8","observation_id":"1d48725b-bda9-4967-b1da-bfb917e68b86","resolution":{"observed_at":"2026-08-10T14:18:10.105545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.109453Z","title":"Towards knowledge transfer in deep re- inforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.109453Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:9badba4c04987aaa1fa6b686df181a77ef34ba544b0a6e3bad62ecd2fcab72ec","observation_id":"441fb47e-62d0-4685-a0ca-326015deff40","resolution":{"observed_at":"2026-08-10T14:18:10.109453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.112790Z","title":"Knowledge transfer for deep reinforcement learning with hier- archical experience replay,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.112790Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:819d4979f9bcba91b5d9d782444b4d7ab7a76a4057c07b10ecc3890e92d76526","observation_id":"adf402fa-03d1-46ca-a924-2e4f4f1a2ecb","resolution":{"observed_at":"2026-08-10T14:18:10.112790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-08-18T00:03:21.764059Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-10T14:18:10.116257Z","title":"Policy distillation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.116257Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:979b5325b2c942753b9a010e41094d98c54254fd87f827fbd15f7ba3ad6508f9","observation_id":"694c384f-d352-4836-84d1-734bd9abb217","resolution":{"observed_at":"2026-08-10T14:18:10.116257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05855","last_updated":"2019-07-11T09:12:42Z","snapshot_observed_at":"2026-08-19T05:34:56.688754Z","submitted_at":"2019-07-11T09:12:42Z","title":"DisCoRL: Continual Reinforcement Learning via Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05855","snapshot_observed_at":"2026-08-10T14:18:10.119843Z","title":"Discorl: Continual reinforcement learning via policy distillation,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.119843Z"},"links":{"cited_paper":"/paper/1907.05855","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:38876bce37e83d8f66d3d70f9078acf9a95309615890fa98a2bf6b960adffc12","observation_id":"34a9096d-79be-4982-a276-1697a6afb037","resolution":{"observed_at":"2026-08-10T14:18:10.119843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.124256Z","title":"Successor features for transfer in reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.124256Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:fd525cceff23947ef89fe303ffb285e39ea35e30071513eb50f134dfadba48f0","observation_id":"2dd48287-a780-4db2-b0aa-c609ad25f77e","resolution":{"observed_at":"2026-08-10T14:18:10.124256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.127567Z","title":"Deep q-learning from demonstrations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.127567Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:128d4fce85b3abe358d203c8420169b0d8150eabe21c6c596d2e501fe87a0695","observation_id":"b7c51cff-082f-42c1-adb5-c739afc95e1a","resolution":{"observed_at":"2026-08-10T14:18:10.127567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.130920Z","title":"Transfer of samples in batch reinforcement learning,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.130920Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a3c393ec92b26ca41f0a099d9e1391f5aeb6acab3c7cabe4ac47cabe7ac6d38a","observation_id":"35d74cc1-6c84-4d6c-91bb-b936653b6e6b","resolution":{"observed_at":"2026-08-10T14:18:10.130920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.134558Z","title":"Don’t start from scratch: Leveraging prior data to automate robotic reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.134558Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:422fa4388d621c11259446c38d77a90aadf4b9fb68d833a2129740241755d142","observation_id":"571b03ec-9ee2-411b-ba47-d487e87e5ad5","resolution":{"observed_at":"2026-08-10T14:18:10.134558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.137994Z","title":"Reinforcement learning agents providing advice in complex video games,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.137994Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:23c3c05feb060068a27553d91248d256952dd0c77ded2f29b0c2513e78a92a2e","observation_id":"5105d4c1-c524-4d0c-9359-bb7d978bd534","resolution":{"observed_at":"2026-08-10T14:18:10.137994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.142107Z","title":"Uncertainty-aware action advising for deep reinforcement learning agents,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.142107Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:3627380982db5ae33fc7e7b54e991fa2b46a7672cb62fbb46bd3dfe72d8d6757","observation_id":"b1516f5e-39c3-4b5a-9b1e-a535107ba624","resolution":{"observed_at":"2026-08-10T14:18:10.142107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.146372Z","title":"Learning by reusing previous advice in teacher-student paradigm,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.146372Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:1f7fbb8b70c54fdf5ffd09ba0076db7dabddd41fbdf9d9f0af0e55c4077a35a3","observation_id":"9f9ab1e1-7e8a-4094-8b49-986f03b6124a","resolution":{"observed_at":"2026-08-10T14:18:10.146372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.149578Z","title":"Experience classification for transfer learning in traffic signal control,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.149578Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:e427aadc18ddf5b5e5d55640e63bf62a2eba66d4d10c75a03cc0fbda8f289d95","observation_id":"8d7086f2-49c8-4741-9a8d-66583dca10db","resolution":{"observed_at":"2026-08-10T14:18:10.149578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.152717Z","title":"Teaching on a budget: Agents advising agents in reinforce- ment learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.152717Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:46866b4410e2b3cac9da4b186916a349af65b8d86172ea73131cddd1344a4710","observation_id":"56994210-7a67-4079-a6fe-de445c93947e","resolution":{"observed_at":"2026-08-10T14:18:10.152717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.155661Z","title":"A q-values sharing framework for multi-agent reinforcement learning under budget constraint,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.155661Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:03647442f322e804e2449c58b38fedec111d1e9e73af337a6800777f629d5ed8","observation_id":"86f2ecd5-f8c7-42b9-8207-abdf74a5ea21","resolution":{"observed_at":"2026-08-10T14:18:10.155661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.13085","last_updated":"2020-03-29T17:42:00Z","snapshot_observed_at":"2026-08-18T12:47:38.681987Z","submitted_at":"2020-03-29T17:42:00Z","title":"Parallel Knowledge Transfer in Multi-Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2003.13085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.13085","snapshot_observed_at":"2026-08-10T14:18:10.742173Z","title":"Parallel Knowledge Transfer in Multi-Agent Reinforcement Learning","venue":"cs.AI","work_id":"b194a648-57c3-4eb3-9ec3-b2e4b7391ed2","year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.158684Z"},"links":{"cited_paper":"/paper/2003.13085","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:94b67668f082d1712534513685f809f49e11ec4910b3fffadce210608c98ee09","observation_id":"5cff5ba3-c59c-43a1-bfd4-b8cc92f00ec2","resolution":{"observed_at":"2026-08-10T14:18:10.746045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.162524Z","title":"Simultaneously learning and advising in multiagent reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.162524Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:ccad9c388baeb925798d4faf7b91333911515da639abd94376ee828465367cdb","observation_id":"d244c424-eb72-4d70-a888-dabecaae2123","resolution":{"observed_at":"2026-08-10T14:18:10.162524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.165953Z","title":"Parallel transfer learning in multi- agent systems: What, when and how to transfer?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.165953Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:5ccbd7ecf6a11ac33e6064eb7d013dc0f8776f28a512fc0f775873006ea3c51d","observation_id":"06eadb1e-8307-4803-bc06-7c2dd7ab565a","resolution":{"observed_at":"2026-08-10T14:18:10.165953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.169241Z","title":"Knowledge transfer in multi-agent reinforcement learning with incremental number of agents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.169241Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:36635ab41e3242561b78dca1d8d7f3e3b69220c6ef3d87bca8e4925879979605","observation_id":"1c803f6e-ad64-42c2-aaaa-2f76bae6034d","resolution":{"observed_at":"2026-08-10T14:18:10.169241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.172507Z","title":"Multi-agent advisor q-learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.172507Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:9a36d07c423825c61c4d5ca1a6e5549d47e48765fc6355301691327161493a27","observation_id":"f504b1b7-6568-499f-a87c-3d4f622a4acb","resolution":{"observed_at":"2026-08-10T14:18:10.172507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.176436Z","title":"Teaching on a budget in multi-agent deep reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.176436Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:e92210d679bdc2c1a13be6eea25f8fdb5abb9eb19424d560cc88b31470e54b79","observation_id":"37ad7085-41ba-4978-b5c7-3f10d2dfdb35","resolution":{"observed_at":"2026-08-10T14:18:10.176436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.179695Z","title":"Selectively sharing experiences improves multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.179695Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:fcd08b5cb93593be680eaf43682f00e2d050e95efee7e0baf8b7a67cc8455e37","observation_id":"d4c98079-fba8-4588-b897-d44c5669aaf4","resolution":{"observed_at":"2026-08-10T14:18:10.179695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.182842Z","title":"Ferber,Multi-Agent Systems: An Introduction to Distributed Artificial Intelligence, 1st ed","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.182842Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:361359e776a58f7833b0f21536cd90b9d5126e07eac759afd32db1e1a17b90b1","observation_id":"1d79fad9-d46d-4738-ace0-f81890dbee71","resolution":{"observed_at":"2026-08-10T14:18:10.182842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.186135Z","title":"Multi-agent deep reinforcement learning for large-scale traffic signal control,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.186135Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:1d80ff2717787a3d65512661640844d099f3b33250b10c91938a2cf4470def9b","observation_id":"0548c6a8-7f8b-4c0e-9c84-860d4e112e9b","resolution":{"observed_at":"2026-08-10T14:18:10.186135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.189432Z","title":"Tar- mac: Targeted multi-agent communication,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.189432Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:d5306b7ca96d2bf1bb8ad0f6337e7f290819498b1801c36f6f48f14debfe0a29","observation_id":"04feef5e-efd6-4e23-ba3a-431ef247ac27","resolution":{"observed_at":"2026-08-10T14:18:10.189432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.192663Z","title":"Learning attentional communication for multi-agent cooperation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.192663Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:378a37b6656c3c76f783ea31a93d8f0e9ea90246c1939573fb30ff4320a01cef","observation_id":"76382438-2458-4bf8-8f9e-843887b5a65a","resolution":{"observed_at":"2026-08-10T14:18:10.192663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.195564Z","title":"⨿⌈-learning: A collaborative distributed strategy for multi-agent reinforcement learning through consensus + innovations,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.195564Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:f75a0a4bf11091d9f75c2bf3ff1103bdd653fc460f35e92f386e145dfb7e450e","observation_id":"58a2751a-ce89-46b3-b4e1-a8f157d8b063","resolution":{"observed_at":"2026-08-10T14:18:10.195564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.198808Z","title":"Monotonic value function factorisation for deep multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.198808Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:1f36fafc537c0e45d03c7693e1dba9b8902c8f3e585c30a64ef8515c3fc4fc3a","observation_id":"a1080e28-513e-4c70-ac68-7a316fcc628e","resolution":{"observed_at":"2026-08-10T14:18:10.198808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-08-14T20:53:35.783079Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-10T14:18:10.202651Z","title":"Value-decomposition networks for cooperative multi-agent learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.202651Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:7be9abdab83813b808e7646ca07004bb8319bfac23788c1ff7ad5cc0ea219bb2","observation_id":"c6a5af7c-0fda-4ddf-9af6-ac8a730233b7","resolution":{"observed_at":"2026-08-10T14:18:10.202651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.206289Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.206289Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:900b88d8b719162c435f0945c2bef2c1db3eeab7ee4faeb72c8fb1d28ed43a82","observation_id":"d45f91dc-5441-4615-a43d-4484c502e029","resolution":{"observed_at":"2026-08-10T14:18:10.206289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.209208Z","title":"Q-rts: a real-time swarm intelligence based on multi-agent q-learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.209208Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:f6565677b5508fef4b4156d5c994a35799faef4b556d74d13455e821d66927fc","observation_id":"759c23a2-8062-4913-85a4-0ff1b7466526","resolution":{"observed_at":"2026-08-10T14:18:10.209208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.212019Z","title":"Multi-agent reinforcement learning: Independent vs. cooperative agents,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.212019Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:823763dff283c12ba1f7eefefaefec87ff50ff620ec85cb9c22ba8a956ce09d9","observation_id":"2fa5d8c5-6546-47eb-adac-cc00ecebda6f","resolution":{"observed_at":"2026-08-10T14:18:10.212019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.215150Z","title":"A data-driven multi-agent autonomous voltage control framework using deep reinforcement learn- ing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.215150Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:47d85cbc7275d4473459326520a7d9ef8456e3a47e44094dd1899bdb35d6cea0","observation_id":"620325ee-7f5e-46b6-bcbc-cea1bcde9bff","resolution":{"observed_at":"2026-08-10T14:18:10.215150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.218475Z","title":"A centralized reinforcement learning method for multi-agent job schedul- ing in grid,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.218475Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:2bc43348dc27daae9850e888ae3e31e5b00e1bde85f4f79005c4d2680b48b3fb","observation_id":"3fc523a0-a96f-4cf3-9341-f3da9143e6cb","resolution":{"observed_at":"2026-08-10T14:18:10.218475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09152","last_updated":"2019-10-21T05:07:42Z","snapshot_observed_at":"2026-08-16T00:59:06.026084Z","submitted_at":"2019-10-21T05:07:42Z","title":"A New Framework for Multi-Agent Reinforcement Learning -- Centralized Training and Exploration with Decentralized Execution via Policy Distillation","version":1},"cited_work":{"arxiv_id":"1910.09152","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.09152","snapshot_observed_at":"2026-08-10T14:18:10.721889Z","title":"A New Framework for Multi-Agent Reinforcement Learning -- Centralized Training and Exploration with Decentralized Execution via Policy Distillation","venue":"cs.LG","work_id":"76eda1c3-4531-44b5-a7be-2e7317bd1b9e","year":2019},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.222167Z"},"links":{"cited_paper":"/paper/1910.09152","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:123244bb019f42e731180420f985638c764be835de0252004e78d2394d2ad511","observation_id":"4c757d87-a9d3-4ca0-b4c0-7b5eacd239d5","resolution":{"observed_at":"2026-08-10T14:18:10.725830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.225634Z","title":"Counterfactual multi-agent policy gradients,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.225634Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:df6403bfff095eab711cd212a547146bdad1a0afa17d130a59d77567f7900211","observation_id":"d832a1e3-568f-4383-8981-1f1fe0471745","resolution":{"observed_at":"2026-08-10T14:18:10.225634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08776","last_updated":"2018-05-22T00:31:03Z","snapshot_observed_at":"2026-08-19T17:14:57.065849Z","submitted_at":"2018-05-22T00:31:03Z","title":"Scalable Centralized Deep Multi-Agent Reinforcement Learning via Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.08776","snapshot_observed_at":"2026-08-10T14:18:10.228944Z","title":"Scalable central- ized deep multi-agent reinforcement learning via policy gradients,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.228944Z"},"links":{"cited_paper":"/paper/1805.08776","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:47a750c3b72bb6184a12c2d666cece85806cb4df09b81e53ff80b4f08ff4238a","observation_id":"470aba8c-c5e7-40d4-8d39-472d0332c892","resolution":{"observed_at":"2026-08-10T14:18:10.228944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.232284Z","title":"Cooperative multi-agent control us- ing deep reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.232284Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:60e63918e54585d11c84d35929ce0d875196b590254786c74eeb2922c16dee34","observation_id":"a6ce38b1-e0f3-46ec-bf5b-c005932cb6a2","resolution":{"observed_at":"2026-08-10T14:18:10.232284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-10T14:18:10.235354Z","title":"Exploration by random network distillation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.235354Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:71c4386bbc42e9daf71ee7ce778b9013ec22b4a78db29a3dd88ab21ae6023501","observation_id":"b75ca6a5-10c4-4179-9cf1-2c6be6a66ea7","resolution":{"observed_at":"2026-08-10T14:18:10.235354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.238620Z","title":"Surprise and curiosity for big data robotics,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.238620Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:12dc8a5f0840d4461d829a39531ccf2f1c52e893f6f6d69871bab37eaebe6512","observation_id":"53bc8a60-7e3e-471f-b9c9-56d26b0fea33","resolution":{"observed_at":"2026-08-10T14:18:10.238620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-19T15:54:12.095845Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T14:18:10.241911Z","title":"Minigrid & miniworld: Modular & custom- izable reinforcement learning environments for goal-oriented tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.241911Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:1652d9bb18c20d80850e052939bfb8da405c5e6725a6ee8da939bb386b1bb024","observation_id":"47b2dff7-585a-4102-b177-11276443a59b","resolution":{"observed_at":"2026-08-10T14:18:10.241911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.246536Z","title":"Half field offense: An environment for multiagent learning and ad hoc teamwork,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.246536Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:25ece41eab7a164c3f2da385eb94e063703938571b371707f6ef5828218fda87","observation_id":"5ebb1e5a-009f-4eb7-abce-5d041fba7d52","resolution":{"observed_at":"2026-08-10T14:18:10.246536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.249707Z","title":"Microscopic traffic simulation using sumo,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.249707Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:991c199f54e593ebcc66bd8176dda470eb0c0144767f9372b16539a8094609fb","observation_id":"b46db65e-ac42-4f6a-accb-5bb5605ec80c","resolution":{"observed_at":"2026-08-10T14:18:10.249707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00424","last_updated":"2021-12-01T11:23:40Z","snapshot_observed_at":"2026-08-16T17:37:54.352857Z","submitted_at":"2021-12-01T11:23:40Z","title":"Multi-Agent Transfer Learning in Reinforcement Learning-Based Ride-Sharing Systems","version":1},"cited_work":{"arxiv_id":"2112.00424","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.00424","snapshot_observed_at":"2026-08-10T14:18:10.685690Z","title":"Multi-Agent Transfer Learning in Reinforcement Learning-Based Ride-Sharing Systems","venue":"cs.LG","work_id":"bd7d2147-b6da-457b-88d2-d52f984f1560","year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.252833Z"},"links":{"cited_paper":"/paper/2112.00424","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:0b65eb2e92d9b3ab112a2a3d44ef372a2d8931fa43a6756a872f3fa915dbcff5","observation_id":"832cbb6c-2e75-4c66-bbca-8a8e7bd811ef","resolution":{"observed_at":"2026-08-10T14:18:10.689291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.256379Z","title":"Markov decision processes,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.256379Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:786b2ae0d98bb9323562ade2c00868f12f3b3ec7a94e7fdf8d4405ffcbab9366","observation_id":"2f490b55-b72f-4849-9b8c-6f691c75e321","resolution":{"observed_at":"2026-08-10T14:18:10.256379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.259603Z","title":"Planning and acting in partially observable stochastic domains,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.259603Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:4467fe9b0b57a75d49d80b94bc052282f106c70169e9a3eb952839b9dc44f78b","observation_id":"8e4ebb8a-6dca-424b-a59d-cbb3a245e405","resolution":{"observed_at":"2026-08-10T14:18:10.259603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.262686Z","title":"Actor-critic algorithms,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.262686Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a899868b47fff7bb4f367ea2150901d0dcf4e68319e359e1bdf7b875e7adbb74","observation_id":"8c4de07c-1c0a-4d45-b617-84b41cb0e53c","resolution":{"observed_at":"2026-08-10T14:18:10.262686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.265864Z","title":"Q-learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.265864Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:dc9e5b367792255998c5fc04235e40f693cbcedc591faf7afddb5f4e764eb529","observation_id":"4692160c-3cc6-4631-8dd1-23464ef9df83","resolution":{"observed_at":"2026-08-10T14:18:10.265864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.269012Z","title":"Robot juggling: implementation of memory-based learn- ing,","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.269012Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:be50bd25da6aac9e8a6240356a0741b29ba1646bbcfca1b28de3c2520c344111","observation_id":"c53620a2-f281-4b18-b8b9-fae676464604","resolution":{"observed_at":"2026-08-10T14:18:10.269012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.272585Z","title":"Automatic programming of behavior-based robots using reinforcement learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.272585Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:443258c5b7ba7920a31ea2f7192f52fc5228238019fa6c79d71c650656d4fd81","observation_id":"8e0c0091-c059-47b7-b285-95b301435c30","resolution":{"observed_at":"2026-08-10T14:18:10.272585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.276181Z","title":"Q-learning for robot control,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.276181Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:0941631ecd7f927550533f7e88e7461e42c2e2d2e05c07a12d10bcedaa257f17","observation_id":"f76d3bc4-be1b-43b6-b1ec-aa7f5472507e","resolution":{"observed_at":"2026-08-10T14:18:10.276181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.270010Z","title":"Reinforcement learning in the multi-robot domain,","venue":null,"work_id":"b766bfa0-a3b6-4334-9ce6-992c0ac77edc","year":1997},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.279367Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:e7257764bbbb18148a2b0512120a26a532fba4761df00de4549c3c3bbadb71c8","observation_id":"94360eb1-4b54-499a-9513-c5879251e338","resolution":{"observed_at":"2026-08-10T14:18:11.274584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.260470Z","title":"A reinforcement learning algorithm to train a tetris playing agent,","venue":null,"work_id":"19e86155-f911-42ce-9141-17fcfcd04d97","year":2014},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.282380Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:de1093906392edb9566df64abd50686341c710f0a59212c9bd8b44260b1be4b5","observation_id":"66b2b87a-1793-4c70-9692-6c888d12a2cf","resolution":{"observed_at":"2026-08-10T14:18:11.263849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.240412Z","title":"Predicting how people play games: Reinforcement learning in experimental games with unique, mixed strategy equilibria,","venue":null,"work_id":"c02e1793-3e7e-47ea-9c28-ff702531fc8d","year":1998},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.288444Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:37a1dfbd72b981fceaa0a3dc1beff4b3e51b9517af7ff4112cd6548d7f02899f","observation_id":"6e49f258-b376-44f5-a63c-5a15c1acda90","resolution":{"observed_at":"2026-08-10T14:18:11.244018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.229713Z","title":"Samod: Shared autonomous mobility-on-demand using decentralized reinforcement learning,","venue":null,"work_id":"4260f245-effb-47ca-8dca-d6f143fce04b","year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.291917Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:12254468a057311f416e7ea4651a26ea5cbde000d1a5c2fc86185969b0bae3b2","observation_id":"f0485a4c-911d-4ec0-854f-08934e250a9f","resolution":{"observed_at":"2026-08-10T14:18:11.233740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T14:18:10.295070Z","title":"Openai gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.295070Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:2aa06ae0b3e8791e818ddd1280f023ce5a5799bdc16bc557049c6016643d4427","observation_id":"883c408c-091c-4ef3-a2e8-12159b0a0a04","resolution":{"observed_at":"2026-08-10T14:18:10.295070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.298719Z","title":"Challenges of real-world reinforcement learning: definitions, benchmarks and analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.298719Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:de49abe1aa34088a18a41f0039d3b7ab3a9dfdc02cf1a74929b89c06c9b1d944","observation_id":"6f9c0699-c3b3-4655-90cf-44ae3c0a8bb0","resolution":{"observed_at":"2026-08-10T14:18:10.298719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-08-14T16:39:48.171461Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-08-10T14:18:10.301792Z","title":"Challenges of real-world reinforce- ment learning,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.301792Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:3f4b7a72f8129c1b113da99b0905c820500d3f0747e05d09c51f813c8a0e968f","observation_id":"5f899039-aa5a-45fa-ad51-79e825135256","resolution":{"observed_at":"2026-08-10T14:18:10.301792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.214421Z","title":"A logical calculus of the ideas immanent in nervous activity,","venue":null,"work_id":"d6e79604-7186-456b-91a4-a49c86c563d0","year":1943},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.305665Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:c4db8653133eb4ec5626547bf80c1dc1ae540c94bcf1af576010f1973afbc4aa","observation_id":"d03c0437-ccad-44f8-b4c6-4cc0bd2c1ef8","resolution":{"observed_at":"2026-08-10T14:18:11.217977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.204368Z","title":"Learning representations by back-propagating errors,","venue":null,"work_id":"00fcbd1e-ed4e-4018-b8c4-fe7083bb803f","year":1986},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.308854Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:e18c44e3221a621d13a1658064f0e18064ee87babe99c15aa1b0e0d9477dc5ae","observation_id":"6ce00d39-522c-4f92-bde4-805f679238c6","resolution":{"observed_at":"2026-08-10T14:18:11.208320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.195062Z","title":"State-of-the-art in artificial neural network applications: A survey,","venue":null,"work_id":"da928360-ef6e-4c96-b7d8-087be12cb1fe","year":2018},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.312176Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:09a3817484416b16f44aa7c555e5188a326b169e7c2360e402bc41f7d3acd946","observation_id":"e74f122b-9219-42a4-8302-b34da831fa8b","resolution":{"observed_at":"2026-08-10T14:18:11.198404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.185705Z","title":"Deep sparse rectifier neural networks,","venue":null,"work_id":"3ff5cf02-39bc-4b4b-9d00-dc83db61366e","year":2011},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.316410Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:07e5dce62c8eaa7a6d3e97fc18ef56b22bdd393960045bff5bfebe786c890a8b","observation_id":"1ed8d16c-2386-45c9-9e8c-db2408a33eb2","resolution":{"observed_at":"2026-08-10T14:18:11.188953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.320101Z","title":"A fast learning algorithm for deep belief nets,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.320101Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:a73c098722f1ffba6f078b5b1d1b72845ac5c264b78d41fec1eb4ab216847ed4","observation_id":"8d7b48dc-7135-4b2b-9de0-d3779058a52b","resolution":{"observed_at":"2026-08-10T14:18:10.320101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.323268Z","title":"Gradient-based learning applied to document recognition,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.323268Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:87ba65b4d27f6c634ded04b30e2e61c2fedaa1f46524acf5304cafb9a9ae5707","observation_id":"66fa8eec-40a1-4935-8f92-ac7e22c45826","resolution":{"observed_at":"2026-08-10T14:18:10.323268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:11.164533Z","title":"Probabilistic interpretation of feedforward classification network outputs, with relationships to statistical pattern recognition,","venue":null,"work_id":"2bf1dcc6-9a39-4c27-ac52-9e076c410b87","year":1990},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.326885Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:cecd9c085bb2e0c1e51f02be51968316d23ae83e106077f0cfc570105d272b88","observation_id":"f745f936-bbd5-4818-aef6-f6230f8406d3","resolution":{"observed_at":"2026-08-10T14:18:11.168231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-08-19T05:19:50.480481Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-08-10T14:18:10.330135Z","title":"Adadelta: an adaptive learning rate method,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.330135Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:970138c2b1afaa07751edb0021eab218bcfd8aa837d9473ebab73b1ef9100150","observation_id":"4a2f7359-ec79-46c3-b98b-fa579d5e17c6","resolution":{"observed_at":"2026-08-10T14:18:10.330135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-10T14:18:10.333581Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.333581Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:3aa7851e88e5e8dee3ae407e0f67f9c88a1f4e7af3d5a299f7652e9a1c97a41d","observation_id":"ed1a3776-d9a4-4d46-9732-281119dbf755","resolution":{"observed_at":"2026-08-10T14:18:10.333581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.336725Z","title":"Neural networks for machine learning lecture 6a overview of mini-batch gradient descent,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.336725Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:5dda557b68b018bb777c4be2446249fa7ee115c2ae550e41e17023d893446cfe","observation_id":"02ce3934-0ac4-4cbe-9579-9fa65c048ccb","resolution":{"observed_at":"2026-08-10T14:18:10.336725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:18:10.339798Z","title":"Deep learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.339798Z"},"links":{"citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:53958c60bef4d15cb981a4fda31e9a7ae4834a189503c4681ec7bdc24477a6a1","observation_id":"38a82ada-787a-4f85-86dd-d7709c296283","resolution":{"observed_at":"2026-08-10T14:18:10.339798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T07:58:15.855331Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":88,"verified_exact":3,"verified_fuzzy":9},"total_outbound_references":149},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 149 outbound references and 0 inbound Pith citation observations for arXiv:2501.15495."}