Pith. sign in

Paper Citation Record · LEDGER

Average Reward Reinforcement Learning for Wireless Radio Resource Management

As of 21 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2501.06700.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.06700 v1

Coverage vector

measured 32 of 32 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T20:58:03.027593Z

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

32 of 32 outbound references displayed

  • verified exact1
  • verified fuzzy27
  • unresolved4
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation fe418e7b-8936-457b-be7e-cf0d22d8cbb8 · outbound

This paper cites Reinforcement learning: An introduction by richards’ sutton,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Reinforcement learning: An introduction by richards’ sutton,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.622682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.867946Z digest=sha256:29752c1862c75a4be71e83f903bcd90200b9852fa6e5dbf2577f74c85cf3c94e

Observation 63e51f31-3ce3-41dd-a0f5-29f0c4a04cee · outbound

This paper cites Average-reward off- policy policy evaluation with function approximation,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Average-reward off- policy policy evaluation with function approximation,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.606153Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.873578Z digest=sha256:45d8922d53019187084a7a7252efdfb1209a65737aba77400956cdd6fa568389

Observation 9be1150f-6663-4a75-9b9c-539ee364bde6 · outbound

This paper cites Off-policy average reward actor-critic with deterministic policy search,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Off-policy average reward actor-critic with deterministic policy search,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.589049Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.878783Z digest=sha256:6901049295329d523bca9e3599c30ffe3e9528cbe7a95334d961fe53d523bbc6

Observation 153af67c-6a51-4bce-a795-01b689aa1b11 · outbound

This paper cites Power control for a network of access points,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Power control for a network of access points,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.573092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.883865Z digest=sha256:80e961bf8f9206c7aa0c8f35f551499a2cc03032f56e28fd8f8f845a94e6bb91

Observation 444c08a9-f2dd-430c-992a-1da342f5233d · outbound

This paper cites Base station employing shared resources among antenna units,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Base station employing shared resources among antenna units,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.556489Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.888817Z digest=sha256:4e2b5d76821e48806d646254d0bbca95c02a534ac9e825dbc690b60ac488094f

Observation 832225f1-a78d-4760-b37c-37bcf3a5e033 · outbound

This paper cites Methods and apparatus for power management in a wireless communication system,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Methods and apparatus for power management in a wireless communication system,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.538941Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.893915Z digest=sha256:7d6f132c545bbd433ecdbedeb760d135346d5330f0334240d62a085f23da9986

Observation 9b85fed7-2f67-4e5f-a05b-86b4a65ceb9e · outbound

This paper cites Generalized global bandit and its application in cellular coverage optimization,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Generalized global bandit and its application in cellular coverage optimization,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.522036Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.899554Z digest=sha256:a7bc4b08b2c230be20cbae12ac21154a996305db433af50f66ca6a2a93a800e9

Observation 3048fc99-bf64-4f0d-87f0-7383e2230e45 · outbound

This paper cites A non-stationary online learning approach to mobility management,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management A non-stationary online learning approach to mobility management,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.505499Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.904069Z digest=sha256:98e393aa9a2afd9b839d2fd562c94f1c9f241a55b2649c68c1bfb78c0bb1ca1a

Observation 8b685e6b-9a91-481d-822e-971cf0f84b39 · outbound

This paper cites A Deep Q-Learning Method for Downlink Power Allocation in Multi-Cell Networks.

Average Reward Reinforcement Learning for Wireless Radio Resource Management A Deep Q-Learning Method for Downlink Power Allocation in Multi-Cell Networks

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T20:58:02.908832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:58:02.908832Z digest=sha256:a58678e0c5f6923a03f0c8e31f5b40ffbf4aa85cc5bfdd3c7bac6c1ef03ae73a

Observation 8f0986a6-d45d-476f-b06d-17ed7a5f424d · outbound

This paper cites Power allocation in multi-user cellular networks with deep Q learning approach,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Power allocation in multi-user cellular networks with deep Q learning approach,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.487857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.914367Z digest=sha256:371d80dbc00dc18ee1a798ea7a747e61df8207e5381a3b70d3ad0bdf998b13e3

Observation d86cf87a-3445-470b-a252-e99e5069f05f · outbound

This paper cites Joint power control and channel allocation for interference mitigation based on reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Joint power control and channel allocation for interference mitigation based on reinforcement learning,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.469648Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.919206Z digest=sha256:29f96b5c82c8871db3a206e9c8586b728f6aeb51767afe7bdda0356dbd2a8cfc

Observation e896803b-aba4-4573-b966-ed5796e76b39 · outbound

This paper cites Deep actor-critic learning for distributed power control in wireless mobile networks,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Deep actor-critic learning for distributed power control in wireless mobile networks,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.447250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.923840Z digest=sha256:1cd00486391c410f62c5759457c4290337a590f286a87edc4b563f61e130baaf

Observation a9e7afcb-a20d-4767-806d-f055c673c843 · outbound

This paper cites Deep reinforcement learning based wire- less network optimization: A comparative study,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Deep reinforcement learning based wire- less network optimization: A comparative study,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.429992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.928335Z digest=sha256:d612e2e4b282ef1a380b656cb5bdd94f1d7072a9e72127bed05012e8e698737d

Observation 4a8fb1ba-fd12-4558-8c98-551e9435361f · outbound

This paper cites ColO- RAN: Developing Machine Learning-based xApps for Open RAN Closed-loop Control on Programmable Experimental Platforms,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management ColO- RAN: Developing Machine Learning-based xApps for Open RAN Closed-loop Control on Programmable Experimental Platforms,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.412476Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.933233Z digest=sha256:dcb295927a6d5c9881665b174d063a6e6eded4da4db52bfe9e2411a084f67510

Observation 0efcb88b-4d34-4582-8df1-cf93c067722c · outbound

This paper cites FlexRAN: A flexible and programmable platform for software- defined radio access networks,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management FlexRAN: A flexible and programmable platform for software- defined radio access networks,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.396691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.938283Z digest=sha256:7837920161094230b0d2e10a2994ad30d962cb58a5d9786ee0c83e2aa0d446b4

Observation 04d1d7ad-6a01-41cf-9b35-9849bb3fec9e · outbound

This paper cites Deep reinforcement learning for joint spectrum and power allocation in cellular networks,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Deep reinforcement learning for joint spectrum and power allocation in cellular networks,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.376074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.943681Z digest=sha256:4ab969780d0bcd4a305573b7e679678e77c62b7dd9c7a8a166e22b9414e2ba4f

Observation 8c8a43ac-33d9-4d35-aeda-e0329a01963f · outbound

This paper cites Multi-agent deep reinforcement learning for dynamic power allocation in wireless networks,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Multi-agent deep reinforcement learning for dynamic power allocation in wireless networks,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.359596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.948386Z digest=sha256:a774e181d4bb0b966aef10a364603823a05c3e8d76b61b9633e6579e5ec16b0f

Observation abbb5159-d0a4-4f5a-a14c-376c7d667aa0 · outbound

This paper cites Multi- agent reinforcement learning for wireless user scheduling: Performance, scalablility, and generalization,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Multi- agent reinforcement learning for wireless user scheduling: Performance, scalablility, and generalization,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.340416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.953229Z digest=sha256:8f694f5a6750f115f2df1a2bc72a463e066288a92c8f1d98fa40bdbce5021a4a

Observation 4786d838-3339-4a54-a55a-9d0ad12459ac · outbound

This paper cites Resource management in wireless networks via multi-agent deep reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Resource management in wireless networks via multi-agent deep reinforcement learning,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T20:58:02.958639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:58:02.958639Z digest=sha256:21d291c8df23cdaf92898f0c349236cf5d78c837809e60e2d48e39884dd2ac63

Observation 9f6fe38c-60b8-4321-a8e6-407c26949b68 · outbound

This paper cites Distributed MARL for scheduling in conflict graphs,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Distributed MARL for scheduling in conflict graphs,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.311863Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.963929Z digest=sha256:7dcd01e7b13094d96a48d71bb200079fdaeb825805e98aaecebe520b43896ec0

Observation d2de51e2-2bdd-4ffa-9194-8accdc97981a · outbound

This paper cites Offline reinforcement learning for wireless network optimization with mixture datasets,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Offline reinforcement learning for wireless network optimization with mixture datasets,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.295227Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.970809Z digest=sha256:d904c6ecae7578bd846131629805cfcaae63ea6d8755c853eaba956e14b9e42f

Observation 3daa3c11-e5c9-4b28-bc45-5af3768177b2 · outbound

This paper cites Advancing RAN slicing with offline reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Advancing RAN slicing with offline reinforcement learning,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.279124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.976751Z digest=sha256:9e3f2334e62972eb01b57bfaa63feae3c0a25d38a911b46d7c657e1325c6ed87

Observation 0fc23e0a-4c89-4b71-abaf-532fb6834614 · outbound

This paper cites Mean-variance policy iteration for risk-averse reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Mean-variance policy iteration for risk-averse reinforcement learning,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.261064Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.982057Z digest=sha256:47385c3f761d6e25d1763505e2e6c9254ccebcac80738c47c82c13ddbd597b28

Observation e0aed05d-01fa-49d7-8e9f-d6d13de8f23a · outbound

This paper cites Averaged-dqn: Variance reduc- tion and stabilization for deep reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Averaged-dqn: Variance reduc- tion and stabilization for deep reinforcement learning,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.243701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.987694Z digest=sha256:a5ce124e224af53a20483ec66d33e61765dc54baa53b5ea22d7876ef9a93710d

Observation 38faea7d-0567-4d26-9138-308f0ede6ca3 · outbound

This paper cites Average-Reward Reinforcement Learning with Trust Region Methods.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Average-Reward Reinforcement Learning with Trust Region Methods

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-10T20:58:02.992888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:58:02.992888Z digest=sha256:fd38808ac273586f22a001cd52a5163870ce5dc37993003189addf800af86178

Observation 79263734-8de1-48bf-9c0d-79864f8f6157 · outbound

This paper cites The NS-3 network simulator,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management The NS-3 network simulator,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.224731Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:02.997779Z digest=sha256:04b82139bc07694fc585172e31d3a30d2c6d9abd8e7b7f37c2b84226a9967e45

Observation bf85f0c0-a91e-49a3-b59b-75d2d16428ae · outbound

This paper cites Network slicing architecture,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Network slicing architecture,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.206772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:03.002821Z digest=sha256:fd65f67a311aa5f9e4f503d5c441a6de0e3126cd6c1b512145dd6f99d5a8c0cc

Observation a0c4bc3e-559f-45c2-8445-4840f43886d2 · outbound

This paper cites NetworkGym: Democratizing Network AI via Sim-aaS,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management NetworkGym: Democratizing Network AI via Sim-aaS,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.188710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:03.007765Z digest=sha256:60e12034dd6d9f1309ad13c4df6cb0dd39b78ddb846885562866b501d6034f7a

Observation 77cd05a6-0482-4fbd-8745-f0df02bb77af · outbound

This paper cites Soft Actor-Critic Algorithms and Applications.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Soft Actor-Critic Algorithms and Applications

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T20:58:03.012480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:58:03.012480Z digest=sha256:3c61369af77f7e3c73fba881dd4ebfe1ac90859b0b9c333303088e064282d71e

Observation 75f746b8-3394-412e-9bdd-861ba0a638f8 · outbound

This paper cites A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms.

Average Reward Reinforcement Learning for Wireless Radio Resource Management A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-10T20:58:03.078406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:03.017617Z digest=sha256:d45fcb12de0311db458b7eacc32a962610ba5274ad44e2e5b0659414df80ef50

Observation 8a8d116c-0e34-452f-9949-38b760fd7858 · outbound

This paper cites Revisiting the minimalist approach to offline reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Revisiting the minimalist approach to offline reinforcement learning,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.171997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:03.022995Z digest=sha256:91d22b601a4782cfcc2f40f74140c8b3bf5f43ed0915bea9c3457ec5d9d316ad

Observation 9bc0867d-2531-42e9-b963-a953fdb3ed79 · outbound

This paper cites Supported policy optimization for offline reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Supported policy optimization for offline reinforcement learning,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.154181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T20:58:03.027593Z digest=sha256:20ff35030344a2f93c780d4c2d90c54a72866a975a9c9aad0c08aaf1458c4544

Pith citing papers

No inbound Pith citation observations are available.