{"as_of":"2026-08-09T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af1ec8c448d9c813f75fd141f6be5027f6ef6e083a2d6ce5a80a2562efad1acb","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T16:21:02.619794Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:42:03.341501Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13472","snapshot_observed_at":"2026-07-13T03:08:01.590659Z","title":"Bridging marl to sarl: An order-independent multi-agent transformer via latent consensus","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09422","last_updated":"2026-07-10T13:50:29Z","snapshot_observed_at":"2026-08-02T03:29:36.466642Z","submitted_at":"2026-07-10T13:50:29Z","title":"Action-Factored Multi-Agent Reinforcement Learning for Scalable Quantum Device Tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T03:08:01.590659Z"},"links":{"cited_paper":"/paper/2604.13472","citing_paper":"/paper/2607.09422"},"observation_digest":"sha256:7c9f207075e2edfd26df7743307e9e28a4fd5ad482b8a1d16baa69cc37e13741","observation_id":"88069d6a-9a26-46e2-9735-4ffaba853dc0","resolution":{"observed_at":"2026-07-13T03:08:01.590659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13472","snapshot_observed_at":"2026-08-01T16:42:03.341501Z","title":"Zijian Zhao, Jing Gao, and Sen Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17924","last_updated":"2026-07-20T13:20:29Z","snapshot_observed_at":"2026-08-05T19:18:08.693546Z","submitted_at":"2026-07-20T13:20:29Z","title":"Aggregate in the Advantage, Not the Ratio: A Canonical-Form Analysis of Cooperative Multi-Agent Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T16:42:03.341501Z"},"links":{"cited_paper":"/paper/2604.13472","citing_paper":"/paper/2607.17924"},"observation_digest":"sha256:5a19742102f92f8eaa1b3fd688b74cfb8ca852aae924765cbcecc5c6efa5ee67","observation_id":"e86fa2a0-4660-40d3-8c4f-a290712c33d6","resolution":{"observed_at":"2026-08-01T16:42:03.341501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.13472/citation-record","integrity":"/paper/2604.13472/integrity","json":"/paper/2604.13472/citation-record.json","paper":"/paper/2604.13472"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:01.769117Z","title":"Multi-agent reinforcement learning for resources allocation optimization: a survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:01.769117Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:40d4998ea89d92bece09e456a0a1812b98f39f7aafed0298ba74d3110a5e07ed","observation_id":"3f096986-f7ab-483a-8b87-97dc845136ff","resolution":{"observed_at":"2026-08-02T16:21:01.769117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13415","last_updated":"2025-03-17T17:45:46Z","snapshot_observed_at":"2026-08-07T16:57:08.042985Z","submitted_at":"2025-03-17T17:45:46Z","title":"A Comprehensive Survey on Multi-Agent Cooperative Decision-Making: Scenarios, Approaches, Challenges and Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13415","snapshot_observed_at":"2026-08-02T16:21:01.811472Z","title":"A comprehensive survey on multi- agent cooperative decision-making: Scenarios, approaches, challenges and perspectives,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:01.811472Z"},"links":{"cited_paper":"/paper/2503.13415","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:86198f1ae42b33229e69fe43a103f635f873a53580cb31467ee244c612744e74","observation_id":"0eae5d6b-db86-4266-9bb9-9c2d52d20378","resolution":{"observed_at":"2026-08-02T16:21:01.811472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:01.865496Z","title":"Monotonic value function factorisation for deep multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:01.865496Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:a7842a578d2df846b9988566b938241f70578079bce59ded8aa64541f256499a","observation_id":"c2fafc46-a2fe-4689-bd39-271228bd48c6","resolution":{"observed_at":"2026-08-02T16:21:01.865496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:01.932681Z","title":"Mean field multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:01.932681Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:dd9049c46744b2a5ba4e8904e9e96ca93a19b4f540f1887c21896e0071e02dac","observation_id":"6f2ffcd7-6f47-4cbd-ab7e-c1e1ed2d76ff","resolution":{"observed_at":"2026-08-02T16:21:01.932681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:01.989048Z","title":"Counterfactual multi-agent policy gradients,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:01.989048Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:62cf53e80c33c0ac19564f32cc3ca726e99abf339cdc1017b341aa3308dc8d9f","observation_id":"c95161ea-8219-4d5d-b000-5e0790e3918a","resolution":{"observed_at":"2026-08-02T16:21:01.989048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.042044Z","title":"A review of cooperative multi-agent deep reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.042044Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:00594740707daed287e743a68d43511c97df137646ce4f2bf3179d01a94d5947","observation_id":"c530e9fd-bd06-472a-8a94-1b9a3e9e1569","resolution":{"observed_at":"2026-08-02T16:21:02.042044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.095138Z","title":"Exponential topology-enabled scalable communication in multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.095138Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:0c761bcdbc3a789ab42618771f29b972b397b2e85658706e3b8b8180580f451f","observation_id":"b3dab8c9-46c2-4002-b1a9-ff093767f184","resolution":{"observed_at":"2026-08-02T16:21:02.095138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.179058Z","title":"Multi-agent reinforcement learning is a sequence modeling problem,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.179058Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:f96f9ccbbb858c533fa5bd3e09ac2312516ee738c02943cc360db740ff71a01f","observation_id":"dd9558b8-a9aa-4285-8b40-dbc30a9981d7","resolution":{"observed_at":"2026-08-02T16:21:02.179058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.237103Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.237103Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:d2791174f2212ec670bb32643726fb14afef7f514aedf9beda0993ddb935276f","observation_id":"8cdac679-90f3-475d-99bc-823d431b9cca","resolution":{"observed_at":"2026-08-02T16:21:02.237103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.295041Z","title":"Pmat: Optimizing action generation order in multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.295041Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:8a78a1f34c076c907cd42949b1fb8ecacdf9b9c7f2fb3e56c0983350a101ccf2","observation_id":"fe78d248-508f-4547-b5b7-0993f516a8fd","resolution":{"observed_at":"2026-08-02T16:21:02.295041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.351138Z","title":"Aoad-mat: Transformer-based multi-agent deep reinforcement learning model considering agents’ order of action decisions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.351138Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:3a7a24e0cff1a3cf0b1a4015c008da0af73ebba695e74cf2475aa56839480baa","observation_id":"48899a0e-78e4-4e12-927c-014cf8dfdefd","resolution":{"observed_at":"2026-08-02T16:21:02.351138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.354954Z","title":"Triple-bert: Do we really need marl for order dispatch on ride-sharing platforms?,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.354954Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:cedf28dd4ab36143a9e9d01a8f199e3428df3680b84af1ff5b4902517ff5ca85","observation_id":"8028283e-e66f-4b9e-9598-d9626bd8b2bb","resolution":{"observed_at":"2026-08-02T16:21:02.354954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T16:21:02.358933Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.358933Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:8a40eb169fa4125aaaf97999a3583dad88adf01c26ca95a30205beb3202e2a08","observation_id":"b121257c-fad5-4f54-a114-7094b974b50e","resolution":{"observed_at":"2026-08-02T16:21:02.358933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.363224Z","title":"The starcraft multi-agent challenge,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.363224Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:b8f3ee4a7c1157bcf70b1bcba7811125af0e0219a70d6325c3df02c16cc58a93","observation_id":"26e7f974-a514-4b04-a7c4-72d90f2049a5","resolution":{"observed_at":"2026-08-02T16:21:02.363224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06709","last_updated":"2021-05-07T14:03:40Z","snapshot_observed_at":"2026-07-06T09:04:43.836543Z","submitted_at":"2020-03-14T21:29:09Z","title":"FACMAC: Factored Multi-Agent Centralised Policy Gradients","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.06709","snapshot_observed_at":"2026-08-02T16:21:02.367590Z","title":"Deep multi- agent reinforcement learning for decentralized continuous cooperative control,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.367590Z"},"links":{"cited_paper":"/paper/2003.06709","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:a347d6eb5575d01bdc18fcd5b9e703ac4a3ea30a54fa6d1b9c6df21c1a056642","observation_id":"a3370656-0e27-4c4a-8513-0cbec2b39286","resolution":{"observed_at":"2026-08-02T16:21:02.367590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.372140Z","title":"Google research football: A novel reinforcement learning environment,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.372140Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:c9d19aa4552190be4be63283fff9972b56fd949f8a424f27ddaaadee59da831b","observation_id":"6e5439ed-d20f-425e-a942-723cff0a09a8","resolution":{"observed_at":"2026-08-02T16:21:02.372140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.376025Z","title":"Markov games as a framework for multi-agent reinforcement learning,","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.376025Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:a0be35fe25386502c325b6878969bdb53ed84d60e4f8825b0bc443c03d56c2a4","observation_id":"76707ac2-3a8f-4c4c-bde9-af29e2d36abb","resolution":{"observed_at":"2026-08-02T16:21:02.376025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-08T15:29:26.223468Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-02T16:21:02.379885Z","title":"High-dimensional continuous control using generalized advantage estimation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.379885Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:c573c8f9900c50811626160747eb2901360516a0ec2a089e3a559a700e9712ea","observation_id":"4adf6899-05b3-46f1-8822-2688a325d873","resolution":{"observed_at":"2026-08-02T16:21:02.379885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.384022Z","title":"Trust region policy optimisa- tion in multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.384022Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:9b782ae0b87b29fb37e2fdc1ed03c9696bd30b84bd9098a848ddbc539e8da8d6","observation_id":"34c0337c-6938-43ce-912e-406f507433e3","resolution":{"observed_at":"2026-08-02T16:21:02.384022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.387737Z","title":"Heterogeneous-agent reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.387737Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:686c29f887217ced3727d929cdf201d295c1bc82a62da0693f4eac13ef97588a","observation_id":"74e170eb-74f7-4fc6-b36b-560a26e51f61","resolution":{"observed_at":"2026-08-02T16:21:02.387737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.392083Z","title":"Maximum entropy heterogeneous-agent reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.392083Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:f3deb5b5a117023ecfb74d166f8df5e7d3ed53279cac2be89a90ac775812a103","observation_id":"b485e56e-dc0c-4853-89b1-1536ddc4a593","resolution":{"observed_at":"2026-08-02T16:21:02.392083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.395765Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.395765Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:6748089b40d3bd88543f5bc540ece56b0163beb97b92d435f5de20f97713eef0","observation_id":"1950890f-8f93-48df-9edd-6b842f533033","resolution":{"observed_at":"2026-08-02T16:21:02.395765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.400049Z","title":"Csi-bert2: A bert-inspired framework for efficient csi prediction and classification in wireless communication and sensing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.400049Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:6a1fcc8af6ea58c1d9615001d62a5e5b167000d3092b6c606c985e0db3b1f864","observation_id":"20cebcbb-d358-42ab-9fcc-b074f8c1fe4a","resolution":{"observed_at":"2026-08-02T16:21:02.400049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.404188Z","title":"Midibert-piano: Large-scale pre-training for symbolic music classification tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.404188Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:b8dcfc6cc90f406ead4601dc7a5b892bf89de0c3ed10b7fcc8c16a80290c106b","observation_id":"12d7b636-5fcc-4969-9ed0-520bb6fe9902","resolution":{"observed_at":"2026-08-02T16:21:02.404188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.408153Z","title":null,"venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.408153Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:36ed922667a4bf6cf5a8461779fc8d186001a898142d87ed79975470b6646d83","observation_id":"76cab228-b24e-422c-8dba-59ee1002798f","resolution":{"observed_at":"2026-08-02T16:21:02.408153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.412093Z","title":"The analysis of permutations,","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.412093Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:51d0cfd068d5902f315d2ac67926e5b927e4a29964b8b93f23ad206d427b0e93","observation_id":"2a1f538c-e18c-4705-9b4a-ac4211823aaa","resolution":{"observed_at":"2026-08-02T16:21:02.412093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.416124Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.416124Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:eed5d8ed3f763b980051783950eaad5e7681fa9890fa9b4b52d56088b3d4f645","observation_id":"b23b8c9d-8cc3-43f8-91bb-4bb5db6e9c60","resolution":{"observed_at":"2026-08-02T16:21:02.416124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01058","last_updated":"2023-12-02T08:04:31Z","snapshot_observed_at":"2026-08-09T00:16:31.851954Z","submitted_at":"2023-12-02T08:04:31Z","title":"A Survey of Progress on Cooperative Multi-agent Reinforcement Learning in Open Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01058","snapshot_observed_at":"2026-08-02T16:21:02.420089Z","title":"A survey of progress on cooperative multi-agent reinforcement learning in open environment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.420089Z"},"links":{"cited_paper":"/paper/2312.01058","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:c075025276d30e2ee9025b83406b99c3b50ed708db9107b4407b43a6818fd856","observation_id":"f7e3f403-dfe6-4f9d-b1e0-7272e0f979dc","resolution":{"observed_at":"2026-08-02T16:21:02.420089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.424864Z","title":"Hysteretic q-learning: an algorithm for decentralized reinforcement learning in cooperative multi-agent teams,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.424864Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:48de1fb8bf042977c87b81de7938f7388f0d65f7593a25147a8f6ccc83948aea","observation_id":"e926ffce-7d9a-4a68-bd1e-860268622628","resolution":{"observed_at":"2026-08-02T16:21:02.424864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07029","last_updated":"2018-11-13T11:30:29Z","snapshot_observed_at":"2026-07-06T07:15:15.773729Z","submitted_at":"2018-11-13T11:30:29Z","title":"Modelling the Dynamic Joint Policy of Teammates with Attention Multi-agent DDPG","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07029","snapshot_observed_at":"2026-08-02T16:21:02.429019Z","title":"Modelling the dynamic joint policy of teammates with attention multi-agent ddpg,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.429019Z"},"links":{"cited_paper":"/paper/1811.07029","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:26a99c672649ba108fd751e83ccd597cd1eac57e627d96f6a11b4ef7f4842511","observation_id":"e59494ab-35d2-45a0-8f4c-e35b9c4cb829","resolution":{"observed_at":"2026-08-02T16:21:02.429019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.433472Z","title":"Shapley counterfactual credits for multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.433472Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:40c409c122a477a5d3ec0883766886e922ee50e363d9e634a5f65c0f44eac061","observation_id":"1333c306-e205-405b-81c7-1bddab6cfe52","resolution":{"observed_at":"2026-08-02T16:21:02.433472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.437538Z","title":"Value-decomposition networks for cooperative multi- agent learning based on team reward,","venue":null,"work_id":null,"year":2085},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.437538Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:896583130e646939f44a6503cc232d8e6e55b0fcbe3cdd671917dfa556b17cea","observation_id":"c7c76c0e-bd93-4b51-a981-8b98872f9f0b","resolution":{"observed_at":"2026-08-02T16:21:02.437538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.441687Z","title":"Value-decomposition multi-agent actor-critics,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.441687Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:fd1ee7d9b820603b1516c0d60a7139bd06f7d4c49c51c154dae9394a410a57bd","observation_id":"bfd309f4-d53a-475e-a335-70ddbff9cfed","resolution":{"observed_at":"2026-08-02T16:21:02.441687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.445742Z","title":"Qtran: Learning to factorize with transformation for cooperative multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.445742Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:4d57b33a04d98f606a978591aaeafc5a00411c1a0015c431e90add7b0eb124cd","observation_id":"883e2051-5f2e-4a27-8498-ac80d50dd3ae","resolution":{"observed_at":"2026-08-02T16:21:02.445742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.450144Z","title":"Hierarchical value decomposition for effective on-demand ride- pooling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.450144Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:7a5c347ab74ab95d7e33ec84ab0fb3390abe1f4cdf3463d8483ff2bad5eb338d","observation_id":"9bb1637e-f874-4870-9217-1c4529c5fa9e","resolution":{"observed_at":"2026-08-02T16:21:02.450144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.454531Z","title":"Efficient distributed reinforcement learning through agreement,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.454531Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:39690baaaba5f08599bf32fd70621d02730ff03540e78ec16933f4660185d976","observation_id":"579e79d9-4c37-427f-8178-976efc418e34","resolution":{"observed_at":"2026-08-02T16:21:02.454531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.458864Z","title":"Learning multiagent communication with backpropagation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.458864Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:af2537d22ead83411614c87dc9c1d631f1456fe550d146ef206eb97eb04e4aad","observation_id":"6f261ecc-156a-4a2b-b41d-60ca612a65ed","resolution":{"observed_at":"2026-08-02T16:21:02.458864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.463575Z","title":"Tarmac: Targeted multi-agent communication,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.463575Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:62e9c1860c3036f00fc72803cff5ab124dc58b706c6fa3149310a4066a0c0c5c","observation_id":"f5360e51-5050-4121-8e04-38337102126e","resolution":{"observed_at":"2026-08-02T16:21:02.463575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.468585Z","title":"Context-aware communication for multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.468585Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:8e78e0741028a516bd3332e49312dbb9ea38dd1d14f18bc3458956c0c56184b4","observation_id":"7bd9ca5e-d663-4ce4-b86a-d20541a5b0f0","resolution":{"observed_at":"2026-08-02T16:21:02.468585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.472824Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.472824Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:fe317955dd8f61953b4c063b8fb80724edfa0a81f1a4d27c66036aaa4bca4714","observation_id":"50e8e9e5-2437-4809-8805-c764522e966c","resolution":{"observed_at":"2026-08-02T16:21:02.472824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.477029Z","title":"Automatic stage lighting control: Is it a rule- driven process or generative task?,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.477029Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:9e0a24aaf4fb80080f2c5df521a49d5585df004578af3b17fca9a85e1a134632","observation_id":"05153e96-cb09-4119-a8d5-0ef6e360c6bb","resolution":{"observed_at":"2026-08-02T16:21:02.477029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.481524Z","title":"On transforming reinforcement learning with transformers: The development trajectory,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.481524Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:c564c8937e5a50f33b4c59857669e56eb67dcbf93fec1e9392638a8270a2c4a5","observation_id":"9c54297a-5978-4c0c-8423-4eb5d1c78d10","resolution":{"observed_at":"2026-08-02T16:21:02.481524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.486509Z","title":"Deep recurrent q-learning for partially observable mdps.,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.486509Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:a046f1d9fcc5b5d892542e2c81d40774cff5e536d2e76cecf9a6c5f665562e07","observation_id":"d4175225-f9ca-4fe3-a74f-cf928fd82b46","resolution":{"observed_at":"2026-08-02T16:21:02.486509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.490948Z","title":"Stabilizing transformers for reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.490948Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:155d4ddf402c2cb31e0026309a5024e051b6f37e360ef2c667eea18881388470","observation_id":"fcb1783f-a570-4bb3-86fc-a9c8eae53b7c","resolution":{"observed_at":"2026-08-02T16:21:02.490948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.496161Z","title":"Transdreamer: Reinforcement learning with trans- former world models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.496161Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:1c96c266d67d249836eeb625f52624443f4e2f4521ae1ac9dda4f0ce212e5f13","observation_id":"b4021c4b-bbd7-46b7-903b-0706f4efacf0","resolution":{"observed_at":"2026-08-02T16:21:02.496161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.500851Z","title":"Dream to control: Learning behaviors by latent imagination,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.500851Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:f8cac69ce737adcd8c8ecafca23e702dbb98bdd354729760ba384b34ac183798","observation_id":"e837cc5e-77f0-4396-b413-eae2365afed3","resolution":{"observed_at":"2026-08-02T16:21:02.500851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.505229Z","title":"Offline reinforcement learning as one big sequence modeling problem,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.505229Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:cbce96154ef7da82f77c2d5ce0b8bf9fe138a77646d8331bc12c0a2e6a835f1b","observation_id":"ead0410a-7615-4b65-864e-2c02992164e0","resolution":{"observed_at":"2026-08-02T16:21:02.505229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.509785Z","title":"Decision transformer: Reinforcement learning via sequence modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.509785Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:ae71c503cace645669a17ae267af4383373ef9cc4a50942ecb34036893ccdffc","observation_id":"e2a97379-105f-4446-9ebc-be5aeffeafae","resolution":{"observed_at":"2026-08-02T16:21:02.509785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.514251Z","title":"Online decision transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.514251Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:8b552f9697af0cb523adfd39704642f0221005f0469b409e2cca9aa1e3e019e7","observation_id":"bc209aff-b940-4eef-bcb0-ccec7f89d06a","resolution":{"observed_at":"2026-08-02T16:21:02.514251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.518579Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline rl,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.518579Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:f0d264db7abb7f19a1cd4c8ed008991ec49bb8a850d4f77dd972ac2195fff80e","observation_id":"cf6c4f10-8de8-40f7-a707-43b74033aaa8","resolution":{"observed_at":"2026-08-02T16:21:02.518579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.523011Z","title":"A survey on transfer learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.523011Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:2b373249c6a3078e7aceece5d99d22774849add256b397b45561709ffb0e2072","observation_id":"5b5132bd-1822-4b64-b006-0a9e3b778b07","resolution":{"observed_at":"2026-08-02T16:21:02.523011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12122","last_updated":"2022-07-24T03:13:16Z","snapshot_observed_at":"2026-08-09T06:05:09.269686Z","submitted_at":"2022-01-28T13:55:35Z","title":"Can Wikipedia Help Offline Reinforcement Learning?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12122","snapshot_observed_at":"2026-08-02T16:21:02.527948Z","title":"Can wikipedia help offline reinforcement learning?,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.527948Z"},"links":{"cited_paper":"/paper/2201.12122","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:3e75558055a51c32de5b5d7b30bc1ff8bc8049b7f10b186799748a82f4fd08e0","observation_id":"7e8013a8-78dc-46a8-85f5-b1fbab5ce287","resolution":{"observed_at":"2026-08-02T16:21:02.527948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.534132Z","title":"Pre-trained language models for interactive decision-making,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.534132Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:a6f14d2ff2447c79fa6494491f518311135048dcc100bbd75a3b37b7f12948ce","observation_id":"36b15cf2-806b-46a2-ba6c-fa4c27bdf4a8","resolution":{"observed_at":"2026-08-02T16:21:02.534132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.538636Z","title":"Masked autoencoding for scalable and generalizable decision making,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.538636Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:f3df99e5c6c5e9384f88f3bef73d00961eefeccb588a0d99f4668ad0c2579e15","observation_id":"bbf041bd-b044-4d5f-bcaa-50f97ca770dd","resolution":{"observed_at":"2026-08-02T16:21:02.538636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.542890Z","title":"Masked trajectory models for prediction, representation, and control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.542890Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:3680dbeff77f36009bfe9f3f0d874bf0c5cb73980d630252e9c4506754c7fbe9","observation_id":"83da4276-20b4-4d9b-b98c-30df4d2ede4f","resolution":{"observed_at":"2026-08-02T16:21:02.542890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.547157Z","title":"Prompting decision transformer for few-shot policy generalization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.547157Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:eccc19b5447240a294bb4981adf87e2f8dbc6c1e0d4ad7a507cf06ac3be23ac1","observation_id":"1674ddbf-7bd8-4ad7-ac2b-f891a358a5d4","resolution":{"observed_at":"2026-08-02T16:21:02.547157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08016","last_updated":"2022-11-15T10:00:14Z","snapshot_observed_at":"2026-08-05T00:42:01.896040Z","submitted_at":"2022-11-15T10:00:14Z","title":"Contextual Transformer for Offline Meta Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08016","snapshot_observed_at":"2026-08-02T16:21:02.551334Z","title":"Con- textual transformer for offline meta reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.551334Z"},"links":{"cited_paper":"/paper/2211.08016","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:9c54aa262a98b366d45a406aa666fd176e64d703a6d764bfe9cd7de84b5a5f4c","observation_id":"8dfffbf5-2b6c-432c-903d-7ecc386a5bf1","resolution":{"observed_at":"2026-08-02T16:21:02.551334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.555920Z","title":"Multi-game decision transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.555920Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:5599c76f00199a9f313800905e6ccecd7c65f27f2573d3cd7f6288421d1d2b34","observation_id":"5ea913a1-2f6d-4873-8d80-73be79ff1d30","resolution":{"observed_at":"2026-08-02T16:21:02.555920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-02T16:21:02.560025Z","title":"A generalist agent,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.560025Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:d6b4eb01c1b553fc28c3547e86991d79340670289ffc54094caca0e62d77264f","observation_id":"ee58f0d8-f2e5-49a4-9841-a920c61af595","resolution":{"observed_at":"2026-08-02T16:21:02.560025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.564572Z","title":"Learning multi-agent communication from graph modeling perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.564572Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:773069cafcf583818899b5f7f6a63227e011f8e27039f0a0dff77e0959d879ea","observation_id":"b6855677-f7e7-485b-9261-4db8ef5dd9f1","resolution":{"observed_at":"2026-08-02T16:21:02.564572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.569333Z","title":"MaskMA: Towards zero-shot multi-agent decision making with mask-based collaborative learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.569333Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:bf323f04c75b3d91b76fc78241996969de39600f6afd59a2e0b9513e60bbb339","observation_id":"9e898705-b5a2-403f-acb8-cbf984d7741d","resolution":{"observed_at":"2026-08-02T16:21:02.569333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08001","last_updated":"2021-02-07T10:28:41Z","snapshot_observed_at":"2026-07-06T10:33:59.667626Z","submitted_at":"2021-01-20T07:24:24Z","title":"UPDeT: Universal Multi-agent Reinforcement Learning via Policy Decoupling with Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08001","snapshot_observed_at":"2026-08-02T16:21:02.573583Z","title":"Updet: Universal multi-agent reinforcement learning via policy decoupling with transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.573583Z"},"links":{"cited_paper":"/paper/2101.08001","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:4f8841c6abe517e21025e44fd3bd566d93c19f35508a4582427ee0a479a4d86a","observation_id":"da28a524-71eb-4227-bb91-b28c0c15c02f","resolution":{"observed_at":"2026-08-02T16:21:02.573583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.578153Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.578153Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:afee7d3a69cbefd0ac29f6f989da02b8f8760ce28ef6c95f64cb40605f4e831f","observation_id":"9979c65b-e53a-4e04-bfee-45d9c2fbb720","resolution":{"observed_at":"2026-08-02T16:21:02.578153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.582936Z","title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.582936Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:40ba75c93081ad56f688d1b5eead2514505b26a79a8f5d2c21a01a47acf80b33","observation_id":"555d393e-ac72-41a4-b49c-6503aa0f5fa6","resolution":{"observed_at":"2026-08-02T16:21:02.582936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.588123Z","title":"On the global convergence rates of softmax policy gradient methods,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.588123Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:3cb4124be61f61f734b7b6074c8eb639f9cc5a45a89c9b56faf4d87d49c8886e","observation_id":"1a2f7f55-1a62-4c3b-846c-ddd936e1c0a3","resolution":{"observed_at":"2026-08-02T16:21:02.588123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.593291Z","title":"Convergence rates of bayesian network policy gradient for cooperative multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.593291Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:a1d62ab9707a73f58e0fd319f5a59251056b036afcba97a7fabb66030b04cf9e","observation_id":"f338d6e9-25e1-468f-9c9c-d3e17f36e718","resolution":{"observed_at":"2026-08-02T16:21:02.593291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.597577Z","title":"A reinforcement learning algorithm for obtaining the nash equilib- rium of multi-player matrix games,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.597577Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:90e38f19c487f7e25531e79caeedfe757cb47799947a08ad0b136d5dfcf83dd7","observation_id":"2e5e7145-a2bd-4f41-abcd-95c20cb3a1a6","resolution":{"observed_at":"2026-08-02T16:21:02.597577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.601888Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.601888Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:f59407e7ce74ea7b928f22271e874ecf32f6d47d37222db798303b860c27ac9b","observation_id":"1231b19a-812c-4029-aff3-929cc4b97905","resolution":{"observed_at":"2026-08-02T16:21:02.601888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02422","last_updated":"2023-10-05T21:57:43Z","snapshot_observed_at":"2026-08-03T15:42:31.581756Z","submitted_at":"2023-06-04T17:54:11Z","title":"A Generalized Alternating Method for Bilevel Learning under the Polyak-{\\L}ojasiewicz Condition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02422","snapshot_observed_at":"2026-08-02T16:21:02.606459Z","title":"A generalized alternating method for bilevel learning under the polyak-{\\L}ojasiewicz condition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.606459Z"},"links":{"cited_paper":"/paper/2306.02422","citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:a90703b3c2d2464f3edfcdf0c06e09f18dfaf26d29c7b64a59a06422b043b383","observation_id":"b18a5396-cda9-4e36-9152-d89a9f57580f","resolution":{"observed_at":"2026-08-02T16:21:02.606459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.611061Z","title":"Convergence proof for actor-critic methods applied to ppo and rudder,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.611061Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:d9ea615a8271684242fb77297731fc209a03f4784d893e4d7e5f732e2f43a6f7","observation_id":"ebafba30-f7e3-4883-b89e-458873507b50","resolution":{"observed_at":"2026-08-02T16:21:02.611061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.615304Z","title":"Ppo-clip attains global optimality: To- wards deeper understandings of clipping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.615304Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:d223008385ad93da625e9da0c45cac19177e825f14349132d25d7edbcfa89f55","observation_id":"0aa9669a-712c-4f8d-9397-f41031dc76e5","resolution":{"observed_at":"2026-08-02T16:21:02.615304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T16:21:02.619794Z","title":"Implicit learning dynamics in stackelberg games: Equilibria characterization, convergence analysis, and empirical study,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T16:21:02.619794Z"},"links":{"citing_paper":"/paper/2604.13472"},"observation_digest":"sha256:a7f10ae80cbc88aaac50774c061c54a8c86faa71cee2fb7db1ff839ef77690ee","observation_id":"4b728d8c-b150-403e-90e7-4c909fb11a52","resolution":{"observed_at":"2026-08-02T16:21:02.619794Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.13472","last_updated":"2026-07-27T13:24:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T16:21:01.098429Z","submitted_at":"2026-04-15T04:52:22Z","title":"Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 2 inbound Pith citation observations for arXiv:2604.13472."}