Pith. sign in

Paper Citation Record · LEDGER

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization

As of 17 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2412.07639.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.07639 v2

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T18:46:17.581638Z

measured 34 of 34 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

34 of 34 outbound references displayed

  • verified exact2
  • verified fuzzy6
  • unresolved26
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 2585beef-4765-44c5-b92d-c74fb8ae052d · outbound

This paper cites , " * write output.state after.block = add.period write newline.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization , " * write output.state after.block = add.period write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T18:46:17.456660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T18:46:17.456660Z digest=sha256:425f2a44519c2175391b2e5842fe61b5bd3509c1de9f8d780f8943bb2f729993

Observation 8bef3090-4190-436e-8014-8c19e253ac5f · outbound

This paper cites write newline.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T18:46:17.461660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T18:46:17.461660Z digest=sha256:a661b63df51c7d2ac9cb5272198745e588c4d19eea2d424ae552d9cec18a523a

Observation 3329ad65-970f-43c4-a03e-c27d09aac75c · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.951459Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.466441Z digest=sha256:8452528013039eb343f5fb31ba8b005f567a5a1f00b0405aec59dc3c0327fea3

Observation 70c2ee7e-8890-444e-b408-a0f0e621b83b · outbound

This paper cites Multi-Agent Coordination via Multi-Level Communication.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Multi-Agent Coordination via Multi-Level Communication

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:46:17.671709Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.470709Z digest=sha256:68a00cec2b5b7aceb32fa3163e062f9f34e4010af21e56a6bbbd886cba2934d0

Observation 2df5b566-0ae2-47dc-b93e-d5f663166e77 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.940922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.475746Z digest=sha256:29efdaa08a5c0005b499d6e7c12c070b700c5599e69cfd62a094fb3886164774

Observation 47d95fc6-2c48-430e-8c14-a857d0f8f1f0 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.930107Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.479835Z digest=sha256:8258971ea66592d58456c7e761241e4f43c28969176f2d0b7334b423459925fc

Observation 3f8f3228-f4e4-450c-a40a-999db5777a26 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T18:46:17.483893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T18:46:17.483893Z digest=sha256:1a8a57d380405e1a0d402343aed4f4e672f2b6c1743e58b76de838747823de39

Observation 6bffe705-1e1c-454d-902c-1e1adcda35c7 · outbound

This paper cites Soft Actor-Critic Algorithms and Applications.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Soft Actor-Critic Algorithms and Applications

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T18:46:17.487995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T18:46:17.487995Z digest=sha256:e428b5b5a3c2d1dcec903f73c696aee4a2eecb927c730f28db22c8dab204268b

Observation 569e532e-8196-4fdb-a453-9ae511850052 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.912537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.492178Z digest=sha256:fde74fbc0d7d97d323f0f0175aa1c4272702d65e16786e8e2972bdd6b415a45c

Observation bf11f350-3e7d-4a3d-b4a4-7474d2493e98 · outbound

This paper cites G.; Chen, R.; Wen, M.; Wen, Y.; Sun, F.; Wang, J.; and Yang, Y.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization G.; Chen, R.; Wen, M.; Wen, Y.; Sun, F.; Wang, J.; and Yang, Y

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:46:17.902691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.495763Z digest=sha256:508bfa3fd04ee2f2ad517b58bb46926e72ace357aba47a5e002228addd8be0a9

Observation 78650811-09e7-49f2-a4aa-33148eeae3cd · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T18:46:17.499064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T18:46:17.499064Z digest=sha256:d65c0b7c1330d70b37625c1ad071cc026632e91c92f684890aa6526f60350994

Observation fde00527-41bf-4b32-a2cf-37d97f86ebd4 · outbound

This paper cites Improving Generalization and Data Efficiency with Diffusion in Offline Multi-agent RL.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Improving Generalization and Data Efficiency with Diffusion in Offline Multi-agent RL

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-11T18:46:17.644430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.502439Z digest=sha256:561e4ed049e5678c1eaac17a32163c12de9b8b674101a1db61a022bfe5102c2c

Observation af474bd8-27db-4185-8caa-36c13204a622 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.886510Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.506247Z digest=sha256:f210eb8fa308623837e38ade3984ee7b6c7bd5671a812482777206f4e2180faf

Observation b9283b72-8d96-4262-b258-ffb0707464c8 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.877666Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.509669Z digest=sha256:6655e19f26f2f0b10c2eb2bcdd3a42c04af9c7b894fa3558d68c3eaf3bceb770

Observation acccd921-64bb-4403-b00f-1a2056855d7f · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.868082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.512882Z digest=sha256:ba95fbf7c9dc3e5f04b79ae13bbcb1b38faefee148eeb5c24c26acf372eff659

Observation 419cc7d3-245f-4caf-b2fd-ddc5ea095370 · outbound

This paper cites E.; Lee, J.; Yoon, J.; Leonardos, S.; Abbeel, P.; and Kim, K.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization E.; Lee, J.; Yoon, J.; Leonardos, S.; Abbeel, P.; and Kim, K

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:46:17.857024Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.516238Z digest=sha256:cd0cbd78f56bb70da032e98a3931e3a54ecec49bf590061385f6aed6a3dc9895

Observation 142f1f8e-c43c-4232-8b4a-c5a91f2b93c9 · outbound

This paper cites D.; and Palfrey, T.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization D.; and Palfrey, T

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:46:17.846150Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.519324Z digest=sha256:a6721820e1af8d91d3ddb392b9595a143b481548883e8911d229c65b819fbe95

Observation a6d18b01-5914-4b7b-97c4-4c872f019b44 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 18

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.835791Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.522239Z digest=sha256:399f4f37c66fbc2857ba3bee443285d165554a2530ed67b45271e8181f61082e

Observation 2e412280-ffe3-4f35-9cb2-85ed5f354b29 · outbound

This paper cites S.; Farquhar, G.; Foerster, J.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization S.; Farquhar, G.; Foerster, J

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:46:17.825375Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.525410Z digest=sha256:f9249d202c851db2f4e0cdc9c6d395d60bcec79ad65df9dd465576052d523688

Observation 4e803943-6ce8-4647-afbb-383f5c051e1c · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.813902Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.528767Z digest=sha256:bc6b5b24f438add4735f158f85cb840e437b72e443edc976b34fd386347d4111

Observation dd9c5fe8-d921-4066-87ad-cfaa7aff26a8 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.802710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.532136Z digest=sha256:e3a6e2046dbd8918ad212361479b427d2e7d0b65c7e2fe4a45492a5ec28e60f3

Observation 343ecda5-8128-4110-a083-f722a20287de · outbound

This paper cites J.; Hostallero, D.; and Yi, Y.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization J.; Hostallero, D.; and Yi, Y

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:46:17.791997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.535725Z digest=sha256:78717a2c7c206cfce8f0ec88b9189a0e556c5ed95e8073202735a7746bf0b59d

Observation f6a8cb02-ba31-413a-8e52-05ced676907e · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.780091Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.538775Z digest=sha256:84ec485937bce2cc6d8c2d70e6f4e83d8ae0cff0b91fd5d9d146ce6adbb1374d

Observation 576032bb-89b8-4f5e-aeab-2373141c8210 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.768301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.542136Z digest=sha256:1689c73ea3bc3c96ad047286e0166d575b6b5c2f75db625b7c1d641c3dc626ea

Observation ef2087b7-aefe-40d2-9566-a5d1a16a2df6 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.757357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.545752Z digest=sha256:98225001318405a6a47f7f844ff43896d1ab0d05c8eba91a6988c7429352b492

Observation 190453a1-6e9b-4738-9d8a-bca5bc3438b0 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.746213Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.550838Z digest=sha256:04637ab24533aa6a6eddd52d9366f90dea137e738e0f9c6d3683aef072334a7a

Observation c1d0d3f4-8339-4c04-b38f-d8249696fb76 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.735830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.554942Z digest=sha256:e2e25d05f83e369151945f5a1bb2390417da2cbd3e496312d36e6232ae1212bd

Observation bcc260d7-4177-49cc-98ff-78e648482a03 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.725764Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.558907Z digest=sha256:24776c3c20fe5c98fb6c2d07d573f91bfd817acffc12bb651ff26d77c765f3ae

Observation ce0b7ee3-6478-40aa-bff1-edd48fd4168a · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.715669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.562798Z digest=sha256:a0787b45f429fe61fa5917394b51ab33e928a6488c1ab0a77591bf2f1592e4ab

Observation a0b8b1e2-81ac-4567-aab7-0ab70e04b16f · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.704879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.566462Z digest=sha256:ce9b7ca50f831111f17c2196a5bd340522d34ff648e0fa9fca2a9f27988aea8c

Observation 96b55309-edfd-446f-a81d-d4d080885d95 · outbound

This paper cites an unresolved cited work.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Unresolved cited work

Reference 31

Resolution
unresolved
raw_fallback, observed 2026-08-11T18:46:17.692820Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.570036Z digest=sha256:2101e6ff9d96dd9a93f8081917c6579cf203f07dd2e18fa07de982bf28783441

Observation a01f88b0-1bf2-462f-9148-550ce3f9243c · outbound

This paper cites M.; and Wu, Y.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization M.; and Wu, Y

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:46:17.682432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-11T18:46:17.573647Z digest=sha256:ca56c6bb42b79cdbeccde4053241d13c522c9e7bdb1a375965a9b3bcb7131e86

Observation b104da63-e063-4565-8a43-fbb44c8287df · outbound

This paper cites Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T18:46:17.577423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T18:46:17.577423Z digest=sha256:205cff01b5885fd02072bbe3e8b67fd78b5528173acbe4ad161493eacf8aff52

Observation d9aab2cb-1049-489b-a93f-1ccdfdab2402 · outbound

This paper cites MADiff: Offline Multi-agent Learning with Diffusion Models.

Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization MADiff: Offline Multi-agent Learning with Diffusion Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T18:46:17.581638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T18:46:17.581638Z digest=sha256:2af0ce662afb2383b0edab21a07d83871b57e2a78f249c2af00573866d56f89e

Pith citing papers

No inbound Pith citation observations are available.