{"as_of":"2026-08-15T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3aed4bacb5c3ad7556dd62509926c105b57f6dcc373a852e61501702cbd6f43b","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:46:17.581638Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07639/citation-record","integrity":"/paper/2412.07639/integrity","json":"/paper/2412.07639/citation-record.json","paper":"/paper/2412.07639"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.456660Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.456660Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:4d5242847899c412fd4841500bd82e85b010b0611cc304db7a0588dc389bbe50","observation_id":"2585beef-4765-44c5-b92d-c74fb8ae052d","resolution":{"observed_at":"2026-08-11T18:46:17.456660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.461660Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.461660Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:047d56fffccf0c7709b93b813f37f3bb5b5f1b0513e1a129590163e0d02a2fb2","observation_id":"8bef3090-4190-436e-8014-8c19e253ac5f","resolution":{"observed_at":"2026-08-11T18:46:17.461660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.947623Z","title":null,"venue":null,"work_id":"b14cff5d-38dd-47fd-9f35-580a6d68be56","year":2024},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.466441Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:2792442af0522f8aa8d2e296d4335f4958e024a5e79fdee039618067aeebc18c","observation_id":"3329ad65-970f-43c4-a03e-c27d09aac75c","resolution":{"observed_at":"2026-08-11T18:46:17.951459Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.12713","last_updated":"2024-11-05T15:05:38Z","snapshot_observed_at":"2026-08-14T12:51:32.799451Z","submitted_at":"2022-09-26T14:08:03Z","title":"Multi-Agent Coordination via Multi-Level Communication","version":2},"cited_work":{"arxiv_id":"2209.12713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.12713","snapshot_observed_at":"2026-08-11T18:46:17.667396Z","title":"Multi-Agent Coordination via Multi-Level Communication","venue":"cs.MA","work_id":"7f46258b-96c1-40e2-a410-a4bccd998f1f","year":2022},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.470709Z"},"links":{"cited_paper":"/paper/2209.12713","citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:a64cf9eed4982748f4e2cdef21a1f48d9660cde20eff52268a646c2a3914a1e0","observation_id":"70c2ee7e-8890-444e-b408-a0f0e621b83b","resolution":{"observed_at":"2026-08-11T18:46:17.671709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.937209Z","title":null,"venue":null,"work_id":"fd357046-77ef-424d-bc3d-70d60c646685","year":2024},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.475746Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:4931ac1e2140f17d4032c134ba0807ce6d456c4fce488c617cef0317faa56722","observation_id":"2df5b566-0ae2-47dc-b93e-d5f663166e77","resolution":{"observed_at":"2026-08-11T18:46:17.940922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.926272Z","title":null,"venue":null,"work_id":"72bfea75-7baa-4d3a-9f5a-07b95f657560","year":2022},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.479835Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:26e61a0e4329196177b498c6b763b322649d6cc4e45631fe771721b573929626","observation_id":"47d95fc6-2c48-430e-8c14-a857d0f8f1f0","resolution":{"observed_at":"2026-08-11T18:46:17.930107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.483893Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.483893Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:7943b4b0e0786f61a7df05e1c943091fef835347b51ac047aeab2b32246c34cc","observation_id":"3f8f3228-f4e4-450c-a40a-999db5777a26","resolution":{"observed_at":"2026-08-11T18:46:17.483893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-11T18:46:17.487995Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.487995Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:f49851a896f124e9af60766e1c073d33e5c0858a8a622c7dbe3bac7f61ad3856","observation_id":"6bffe705-1e1c-454d-902c-1e1adcda35c7","resolution":{"observed_at":"2026-08-11T18:46:17.487995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.909352Z","title":null,"venue":null,"work_id":"246c5171-3e3a-44aa-81e5-b8de3b5df4bc","year":2022},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.492178Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:2a60351a3cf750e7f57e541eb73b3a777e55a73f9cf33747d28247291d97fb83","observation_id":"569e532e-8196-4fdb-a453-9ae511850052","resolution":{"observed_at":"2026-08-11T18:46:17.912537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.899771Z","title":"G.; Chen, R.; Wen, M.; Wen, Y.; Sun, F.; Wang, J.; and Yang, Y","venue":null,"work_id":"cf075794-b78a-4ef1-a866-b49e15ecd6cd","year":2022},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.495763Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:7d3b4f0f6612725fe0b5e2a50e3ecdf581358e6bf753d057fdf1d5285e496c9e","observation_id":"bf11f350-3e7d-4a3d-b4a4-7474d2493e98","resolution":{"observed_at":"2026-08-11T18:46:17.902691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.499064Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.499064Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:0ad3855fb03a2fd2bf1201064ccf455cff0304d197da270287358cca68bb5161","observation_id":"78650811-09e7-49f2-a4aa-33148eeae3cd","resolution":{"observed_at":"2026-08-11T18:46:17.499064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01472","last_updated":"2026-06-10T06:01:04Z","snapshot_observed_at":"2026-08-13T11:03:17.064843Z","submitted_at":"2023-07-04T04:40:54Z","title":"Improving Generalization and Data Efficiency with Diffusion in Offline Multi-agent RL","version":2},"cited_work":{"arxiv_id":"2307.01472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.01472","snapshot_observed_at":"2026-08-11T18:46:17.638068Z","title":"Improving Generalization and Data Efficiency with Diffusion in Offline Multi-agent RL","venue":"cs.AI","work_id":"0ca10ee8-82e7-4033-af39-b99bb6f3cdd6","year":2023},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.502439Z"},"links":{"cited_paper":"/paper/2307.01472","citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:8c8963d741817073e437a2df5fb642a01e08193baa8766b5286f451ba5b2d071","observation_id":"fde00527-41bf-4b32-a2cf-37d97f86ebd4","resolution":{"observed_at":"2026-08-11T18:46:17.644430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.883640Z","title":null,"venue":null,"work_id":"7ce638a7-ce9e-4853-9514-31e437aa6e6b","year":2024},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.506247Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:0df9cf28e1179f665b137d102e1b761fa47a8c51f759e041bb67973f05a54b1a","observation_id":"af474bd8-27db-4185-8caa-36c13204a622","resolution":{"observed_at":"2026-08-11T18:46:17.886510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.874850Z","title":null,"venue":null,"work_id":"c1515394-1fb8-4cf9-8945-8f169b35f33f","year":1994},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.509669Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:61e19bbe412f3cf8ebc010cbf62e70e80436e7e46ccaa23ea04e5ca4c8729534","observation_id":"b9283b72-8d96-4262-b258-ffb0707464c8","resolution":{"observed_at":"2026-08-11T18:46:17.877666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.864887Z","title":null,"venue":null,"work_id":"47b6f2b3-4e70-48df-8c67-33a97d194b9f","year":2024},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.512882Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:f327577dea7fc83c260613e00d9723d47341af54d2b472045049dfe5da91c789","observation_id":"acccd921-64bb-4403-b00f-1a2056855d7f","resolution":{"observed_at":"2026-08-11T18:46:17.868082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.853646Z","title":"E.; Lee, J.; Yoon, J.; Leonardos, S.; Abbeel, P.; and Kim, K","venue":null,"work_id":"7d9f5681-3cb8-4747-873d-c5aa5d06f2fe","year":2023},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.516238Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:3cd4e7b210c3993f2ebe5355dbeec7efb49d64ed8d477ecef55da02b8ba6234a","observation_id":"419cc7d3-245f-4caf-b2fd-ddc5ea095370","resolution":{"observed_at":"2026-08-11T18:46:17.857024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.842534Z","title":"D.; and Palfrey, T","venue":null,"work_id":"ece32a6a-b0bd-4df2-bf7a-d29a0555c9a6","year":1995},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.519324Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:c2d7b0cfdf84bea102221010b038618ce6a050921811ef7ef543385d7a58b1c8","observation_id":"142f1f8e-c43c-4232-8b4a-c5a91f2b93c9","resolution":{"observed_at":"2026-08-11T18:46:17.846150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.832578Z","title":null,"venue":null,"work_id":"9c2e5c83-1986-447f-9dfe-fb313aaa0e52","year":2022},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.522239Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:dcffd4f8c43c78f62e5162c99a86e6ce7fc2be82ab735abea9ad0b55109af66c","observation_id":"a6d18b01-5914-4b7b-97c4-4c872f019b44","resolution":{"observed_at":"2026-08-11T18:46:17.835791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.821584Z","title":"S.; Farquhar, G.; Foerster, J","venue":null,"work_id":"457c82d8-92ac-43c0-978b-8505a9b38850","year":2018},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.525410Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:f7d68d6ecaa00ab4646c76a65850cd2d60e603d49edd5780de9e63c745919acd","observation_id":"2e412280-ffe3-4f35-9cb2-85ed5f354b29","resolution":{"observed_at":"2026-08-11T18:46:17.825375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.809988Z","title":null,"venue":null,"work_id":"19cc2567-a587-4d8f-bd43-a6f34cc4934d","year":2019},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.528767Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:7fbeca351cdd18dde9d52509e1a10c71b403ca0dc904b19f3418e43154a47a2d","observation_id":"4e803943-6ce8-4647-afbb-383f5c051e1c","resolution":{"observed_at":"2026-08-11T18:46:17.813902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.799105Z","title":null,"venue":null,"work_id":"2f8d9fba-be5f-48f3-b29e-b59e145ec3df","year":2023},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.532136Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:8576ba1c0ad15b855651bcf8225cbbcfefcb4b33a7ee0d870dc23ca9b004a00c","observation_id":"dd9c5fe8-d921-4066-87ad-cfaa7aff26a8","resolution":{"observed_at":"2026-08-11T18:46:17.802710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.788066Z","title":"J.; Hostallero, D.; and Yi, Y","venue":null,"work_id":"2b85a88d-4cac-4015-9174-4407dbc28521","year":2019},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.535725Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:0a8b8aedac54714d453db5fc7a52650f72a430960455a1ee5df295efa9ba74b7","observation_id":"343ecda5-8128-4110-a083-f722a20287de","resolution":{"observed_at":"2026-08-11T18:46:17.791997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.776419Z","title":null,"venue":null,"work_id":"a8df99f2-b106-4543-958c-90e8783cc7b2","year":2018},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.538775Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:06e4a738e268eaba207e3de57dd1b7db8555615009b406b09d7fe33a93805d36","observation_id":"f6a8cb02-ba31-413a-8e52-05ced676907e","resolution":{"observed_at":"2026-08-11T18:46:17.780091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.764681Z","title":null,"venue":null,"work_id":"48bd6a67-43e5-4c32-929b-357bf63d8510","year":2021},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.542136Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:2990e77ab2f59c4c1bc618b88275940f009201c68a88222bb3c4a4d7c0c8f586","observation_id":"576032bb-89b8-4f5e-aeab-2373141c8210","resolution":{"observed_at":"2026-08-11T18:46:17.768301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.753486Z","title":null,"venue":null,"work_id":"b2d7e888-0f2d-4405-b40a-78784993c4d1","year":2023},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.545752Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:83e2d7ca6f089d602b844e42eacdaca864f9b3cdb336b31bd09abc8a502ce447","observation_id":"ef2087b7-aefe-40d2-9566-a5d1a16a2df6","resolution":{"observed_at":"2026-08-11T18:46:17.757357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.743079Z","title":null,"venue":null,"work_id":"d0c8c01d-3b52-4b80-8267-c4f9bdd7b256","year":2023},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.550838Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:e4dd22f472bb220b5a7e32f5d5929b833033f0a3ccec3bdb626597a0b63384a5","observation_id":"190453a1-6e9b-4738-9d8a-bca5bc3438b0","resolution":{"observed_at":"2026-08-11T18:46:17.746213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.732967Z","title":null,"venue":null,"work_id":"4ca6a850-b137-4215-9ecb-81bb24a4afe4","year":2023},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.554942Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:b11171b6a68c196f12ee44371f5363a7e9b6c1117c492ac4e9721cabda129cd8","observation_id":"c1d0d3f4-8339-4c04-b38f-d8249696fb76","resolution":{"observed_at":"2026-08-11T18:46:17.735830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.722506Z","title":null,"venue":null,"work_id":"c2a17d0a-e2e9-41d1-bed0-6cdd76c00edc","year":2021},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.558907Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:b71acbd31730be1ffe06e25f3757a8b10749cc2d192d27f698cad5caf95a42e3","observation_id":"bcc260d7-4177-49cc-98ff-78e648482a03","resolution":{"observed_at":"2026-08-11T18:46:17.725764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.712187Z","title":null,"venue":null,"work_id":"e68a5be7-8b51-4933-8d75-265cc8c3e53c","year":2023},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.562798Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:bd5502535b6083ae7fd6950ee64690b211e90d96ac576d2e8ba4683fa5eae2e0","observation_id":"ce0b7ee3-6478-40aa-bff1-edd48fd4168a","resolution":{"observed_at":"2026-08-11T18:46:17.715669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.701449Z","title":null,"venue":null,"work_id":"ffd6db19-e223-4137-9fb4-849f239e94cf","year":2023},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.566462Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:5e6fb646d7c24e9a694a901e8e4e07b5bd812c0c420f8b85835b7b7f473bd8bc","observation_id":"a0b8b1e2-81ac-4567-aab7-0ab70e04b16f","resolution":{"observed_at":"2026-08-11T18:46:17.704879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.689296Z","title":null,"venue":null,"work_id":"d41a9a8d-6530-4eb0-b682-e939265587ee","year":2021},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.570036Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:24d9b3fcf1be5364a156a6b4b248046aa144deef32250e97aa2dfc127d3a0ab5","observation_id":"96b55309-edfd-446f-a81d-d4d080885d95","resolution":{"observed_at":"2026-08-11T18:46:17.692820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:46:17.679237Z","title":"M.; and Wu, Y","venue":null,"work_id":"cca12487-eec2-41de-9d9e-56184a58f03a","year":2022},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.573647Z"},"links":{"citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:6ae328b387681befb4dfd05d23c09a216a78f7f857c270ffe066ead0f0057f70","observation_id":"a01f88b0-1bf2-462f-9148-550ce3f9243c","resolution":{"observed_at":"2026-08-11T18:46:17.682432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.10635","last_updated":"2021-04-28T21:33:13Z","snapshot_observed_at":"2026-08-08T14:49:36.216169Z","submitted_at":"2019-11-24T22:50:32Z","title":"Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.10635","snapshot_observed_at":"2026-08-11T18:46:17.577423Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.577423Z"},"links":{"cited_paper":"/paper/1911.10635","citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:4b47122f0612e9be8e757abacfbcdc381754c524fec0f6d173f934555440e312","observation_id":"b104da63-e063-4565-8a43-fbb44c8287df","resolution":{"observed_at":"2026-08-11T18:46:17.577423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17330","last_updated":"2025-01-01T15:35:04Z","snapshot_observed_at":"2026-08-13T11:31:59.160278Z","submitted_at":"2023-05-27T02:14:09Z","title":"MADiff: Offline Multi-agent Learning with Diffusion Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17330","snapshot_observed_at":"2026-08-11T18:46:17.581638Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T18:46:17.581638Z"},"links":{"cited_paper":"/paper/2305.17330","citing_paper":"/paper/2412.07639"},"observation_digest":"sha256:70d089d910995ab39bdd973cda5a39521bfda90ddefdb91fc4dd5654eab7a2e2","observation_id":"d9aab2cb-1049-489b-a93f-1ccdfdab2402","resolution":{"observed_at":"2026-08-11T18:46:17.581638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.07639","last_updated":"2024-12-18T09:04:32Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T21:37:29.800947Z","submitted_at":"2024-12-10T16:19:08Z","title":"Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2412.07639."}