{"as_of":"2026-08-11T16:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d3e1f056e8c8acedc3010286a0252d2b17bb66f509d6259862a6bfb955d8ef8","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:53:31.878138Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.21085/citation-record","integrity":"/paper/2606.21085/integrity","json":"/paper/2606.21085/citation-record.json","paper":"/paper/2606.21085"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:c9562a70cb7ae0d3b1569d9fe304dc0bd7536166c6dd67b11548786c5d5daab7","observation_id":"5e56c8ae-9b97-47ef-a257-e3ab9e932fe3","resolution":{"observed_at":"2026-07-04T06:09:36.628201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:0520fcd71fdf538062e359549d16b05d107b7493716529f1d42f3605ad37d91c","observation_id":"4da55aa2-6ad8-4802-b7e0-98228f68d925","resolution":{"observed_at":"2026-07-04T06:09:36.630789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Accelerating online reinforcement learning with offline datasets,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:887ee8ac68c0da7dffaa9144c346d20659fb92bec13a47fdd1a519f873b43b53","observation_id":"cb33f670-bd87-434c-9cdb-ef1ee4dad3ec","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Offline reinforcement learning with implicit q-learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:f5eb048361b83c011a6952bf75bc957cf804da3c607be3b25d586346a9d00783","observation_id":"a15bbbce-6ff8-4103-8f59-f4e651534e2f","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipulation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:60452d8fe1b7143282bd7a9a3f3d191484f7738183ca7f6127125be830903d13","observation_id":"6a7b4799-8310-4170-9c84-13c087906096","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"A minimalist approach to offline reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:e59801c54ac6ce64ecdada2ea1550582bbae04c9bf42c9846e0869da83df2ec3","observation_id":"6791f76b-ff93-446f-b8af-404759e7aa66","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Policy expansion for bridging offline-to- online reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:11ce4c7ac1fa1db1d585d6e5ae939a311d50a6120d609bdca134919e1a4e6f69","observation_id":"6c84a435-1ae6-4e59-8284-b3a2895a5301","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Bayesian design principles for offline-to-online reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:e06ec8a7b375bd8c4f7c8e1db9aa127ce9b1165a260cff80e355000783e6eca1","observation_id":"04a7f2e6-32f9-49cf-8bd8-b433c0661fb8","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06709","last_updated":"2021-05-07T14:03:40Z","snapshot_observed_at":"2026-07-06T09:04:43.836543Z","submitted_at":"2020-03-14T21:29:09Z","title":"FACMAC: Factored Multi-Agent Centralised Policy Gradients","version":5},"cited_work":{"arxiv_id":"2003.06709","doi":"10.48550/arxiv.2003.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2003.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep multi- agent reinforcement learning for decentralized continuous cooperative control","venue":"arXiv (Cornell University)","work_id":"87e6ae77-5995-40cd-8f19-770f64e0e089","year":2003},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"cited_paper":"/paper/2003.06709","citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:e4686aad6d5b1e3a801af4c9ed72ba2d5cae7dad69bbd8adecb1f0d5938b7eed","observation_id":"3fdf59f5-5d5f-4c84-ae03-3b28cc7a7343","resolution":{"observed_at":"2026-07-04T06:09:36.633975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Opride: Efficient offline preference-based reinforcement learning via in-dataset exploration,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:1ce23d99657c6cd99fc495ddc68cb7a1d54984340a1b21b7944938edbd671790","observation_id":"3a793b8a-4899-4a34-9253-3efceb7105b2","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Batch policy learning under constraints,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:fef56ccfd873a084f884ffde4dcd1c6f1514d6bb42a72a0d4c2b84760caf57f4","observation_id":"3454fff4-12e0-48ac-a4e9-41f5ff6020eb","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Flow to control: Offline reinforcement learning with lossless primitive discovery,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:38a9028bc87d41ae392088f85afbe6cafda250208daa8c61a292fb08140c587b","observation_id":"18438a75-e91c-4842-8308-1f619c6451a9","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:048a6fd45285e73424c3dfa4f3c6d120e3f93b883e24ee78b691a3fe55990bd5","observation_id":"648d7c2e-9240-434f-b9df-8ba1dc4e955e","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:4af21fa5d8c058c0bd1cfbef91ee3538aac63bce9593ee953c36b3e9a935fd97","observation_id":"6993e16f-fcb4-4349-9f1d-5890129fb102","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Behavior regularized offline reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:d70bf7a8762d996aafe69f4175c42e5c509fa58caeca70739b31da52e0e59898","observation_id":"7c801630-ff42-4b77-aeda-774471b68a88","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Critic regularized regression,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:eeb0e9e1298d800a462e0fc707da2c48c1f1c36f6f178c8529870b52f50c12e6","observation_id":"87c45629-542b-458e-8fdc-8758e736f135","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Advantage-weighted regression: Simple and scalable offline reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:baea88d0a521bd7a2c87e3e354acf85c23d5abfdf33adc650d9c9efe0a90b542","observation_id":"03d9989d-ce4d-4349-812c-7da7d6a898ab","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"A survey on offline multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:ef3a53dbe6d4c18bfc135a6f412953b4aed6e857d405ff4b8276fd9b87f091f4","observation_id":"9695e938-52a9-43c4-a9db-dde80651fe69","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Offline multi-agent reinforcement learning: Guidelines and benchmarks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:577a73ae7a52463057dbb2eb713cf5cf38a4ff332263e003dc341cbd9dcd4962","observation_id":"ba2c7537-050c-4a56-92a0-ba15e1e27f03","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Offline multi-agent reinforcement learning with knowledge distillation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:d2e172dc00048c6491794cfbfb455e91013ef9be10694c4ad77bc15e0d38f5ba","observation_id":"2acc15f1-db4f-47b1-8ccc-6aee027fe0ca","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Offline decentralized multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:e2cbc1082921da42f9d8d7bfdbde1212368296b40a4b1db41227adf8ed1ef10f","observation_id":"762331be-8f84-425d-af83-eccf69c2c4ba","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:09:36.623529Z","title":"Globediff: State diffusion process for partial observability in multi-agent systems,","venue":null,"work_id":"5d39f21b-efd0-418c-8c2b-b1fefe7acd2a","year":2026},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:91d44083dafd4589419a2bbdc9edaf1b6c50262cd3a03d624f6bfa80979ef8c9","observation_id":"426bc625-36cd-42cc-96b5-4446e1dae85f","resolution":{"observed_at":"2026-07-04T06:09:36.625245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Believe what you see: Implicit constraint approach for offline multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:d9574504080eb6d40ec71dd554ce2392e18130000d7640f91207b00cb4089f1f","observation_id":"9466d7ba-4cd8-44a4-ab55-7a09b5094875","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Plan better amid conservatism: Offline multi-agent reinforcement learning with actor rectification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:3be5d57460d3b6d199bc595c58f34e13dd5fadf391f2ea37a2ce9d58e7125e99","observation_id":"487d87dd-ba1a-4789-9a00-575b8473d661","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Counterfactual conservative q learning for offline multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:239cb505f3c152779ed824a3c2e054c5b4a2c0b5fed1c802bad142e854217e29","observation_id":"9a4cfc7e-10bb-4c23-b975-d17992854b68","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Offline multi-agent rein- forcement learning with implicit global-to-local value regularization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:13e0b0288a2b12ffcfb75d2d9572a593ee302ebc072c196c73aafa8d47b69f7a","observation_id":"68e56995-11cc-410d-aaeb-817cbc992a6b","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Qmix: Monotonic value function factorisation for deep multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:6c726a4fe5ab6132b8c72dd32c85f7cbac340e33a087c42ff97670a56b245408","observation_id":"d46a85c3-6b36-40cf-8976-2b4de62608dc","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Qplex: Duplex dueling multi-agent q-learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:97cac589dfafadc0eff4eb6f601fb04702f3cfcb1fb54d47b2d99f97a0537b74","observation_id":"a11b9d84-2657-476f-a518-92bdf153ea89","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Cal-ql: Calibrated offline reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:28fd477cc0ae13f13c73d25e4684e779a8ccef92c4ca92a765ffe66258ab4ae9","observation_id":"1eb8af10-ba6d-463f-a3f2-bfcbee1efdb8","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Proto: Iterative policy regularized offline-to-online reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:8534e7d151438652376e610e4b1a145edd62258f93eab97c46eddf5a1fbd18cb","observation_id":"868ee271-a8e6-41f7-a3dc-027c8fb10325","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Efficient online reinforcement learning with offline data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:ee6def60fa263e28d2f52b4eef6f2d048051455fb95eb442817e4afbc8e065c0","observation_id":"8a982434-94a4-4bd5-b4be-d5fc93266f52","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"Trust region policy optimisation in multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:e6e100e74ccf74fd09bf03cfa530b028c0a08daba4ec0ef80481d78b38f6de95","observation_id":"53038486-179f-4854-bc5c-385ff3cdb7d0","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"First, we incorporate the standardized public offline datasets released by the OMIGA benchmark [26]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:90efdbe57ea31654351eae4e0105bc3c98ac3f533dcc46b14c31448ee503e344","observation_id":"a0061c53-725e-4e4b-9428-c7d416096b13","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:b6c9bd4ffa41c06b6652ee3854df05f13696ddf80968218585dfbafe6785c24b","observation_id":"6ed56350-bd92-47a8-97ab-c33aafd14583","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:393b22e0e94c7a19988c9fcdf3492b365355e50a2c80f063389e78795cd150cb","observation_id":"4e75f9f9-1697-48c1-b93a-ec860bb1549a","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:53:31.878138Z","title":"To establish a rigor- ous multi-agent comparison, we extend these algorithms to their multi-agent counterparts, denoted as PEX-MA, AW AC-MA, RLPD-MA, and PROTO-MA","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T14:53:31.878138Z"},"links":{"citing_paper":"/paper/2606.21085"},"observation_digest":"sha256:84f5c711ddd0f38cbdef1c2be99d08977c1d3061d57919d01d1dd2897bfafd87","observation_id":"14a89a6a-86fd-4cdd-9998-99d699ab03af","resolution":{"observed_at":"2026-06-26T14:53:31.878138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.21085","last_updated":"2026-06-19T04:18:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:46:09.475226Z","submitted_at":"2026-06-19T04:18:51Z","title":"Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2606.21085."}