Pith. sign in

Paper Citation Record · LEDGER

Average Reward Reinforcement Learning for Wireless Radio Resource Management

As of 20 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2501.06700.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.06700 v1

Coverage vector

measured 32 of 32 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T20:58:03.027593Z

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

32 of 32 outbound references displayed

  • verified exact1
  • verified fuzzy27
  • unresolved4
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation fe418e7b-8936-457b-be7e-cf0d22d8cbb8 · outbound

This paper cites Reinforcement learning: An introduction by richards’ sutton,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Reinforcement learning: An introduction by richards’ sutton,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.622682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.867946Z digest=sha256:e41fd781d94db5758487e525e01d3bb139d4f70a8a26ee757fe14671b87baf86

Observation 63e51f31-3ce3-41dd-a0f5-29f0c4a04cee · outbound

This paper cites Average-reward off- policy policy evaluation with function approximation,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Average-reward off- policy policy evaluation with function approximation,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.606153Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.873578Z digest=sha256:2b6a2ef45eecd9f9253dfc10a9b49b5aca1f725b95d7cff31217fa7dd7a1347f

Observation 9be1150f-6663-4a75-9b9c-539ee364bde6 · outbound

This paper cites Off-policy average reward actor-critic with deterministic policy search,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Off-policy average reward actor-critic with deterministic policy search,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.589049Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.878783Z digest=sha256:1f14d34373d13f391da81cdea353160baa68b39174f7c48b697e595b04a7f242

Observation 153af67c-6a51-4bce-a795-01b689aa1b11 · outbound

This paper cites Power control for a network of access points,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Power control for a network of access points,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.573092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.883865Z digest=sha256:998c9bfbbddd17829e824dd4b140bed2ccbd8c31a732ec03c21032ca7eca9037

Observation 444c08a9-f2dd-430c-992a-1da342f5233d · outbound

This paper cites Base station employing shared resources among antenna units,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Base station employing shared resources among antenna units,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.556489Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.888817Z digest=sha256:c4266a2d44d6cee3cc65aa6ff6a00a585f17efd22fe2273b9bd8ca660dcd643b

Observation 832225f1-a78d-4760-b37c-37bcf3a5e033 · outbound

This paper cites Methods and apparatus for power management in a wireless communication system,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Methods and apparatus for power management in a wireless communication system,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.538941Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.893915Z digest=sha256:9a5b64a35c5636d30662c975242fa9a2b375f84d9527fbdffc8c549337780e2a

Observation 9b85fed7-2f67-4e5f-a05b-86b4a65ceb9e · outbound

This paper cites Generalized global bandit and its application in cellular coverage optimization,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Generalized global bandit and its application in cellular coverage optimization,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.522036Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.899554Z digest=sha256:721cdb8fa7ce9b0a173add72b1a5ae5d9103da3191be0d6d94f08b2648ac0b9a

Observation 3048fc99-bf64-4f0d-87f0-7383e2230e45 · outbound

This paper cites A non-stationary online learning approach to mobility management,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management A non-stationary online learning approach to mobility management,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.505499Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.904069Z digest=sha256:acc046933ce36678fa6ed6351c96aaa42a5419517937e06f603976194c593720

Observation 8b685e6b-9a91-481d-822e-971cf0f84b39 · outbound

This paper cites A Deep Q-Learning Method for Downlink Power Allocation in Multi-Cell Networks.

Average Reward Reinforcement Learning for Wireless Radio Resource Management A Deep Q-Learning Method for Downlink Power Allocation in Multi-Cell Networks

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T20:58:02.908832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:58:02.908832Z digest=sha256:a58678e0c5f6923a03f0c8e31f5b40ffbf4aa85cc5bfdd3c7bac6c1ef03ae73a

Observation 8f0986a6-d45d-476f-b06d-17ed7a5f424d · outbound

This paper cites Power allocation in multi-user cellular networks with deep Q learning approach,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Power allocation in multi-user cellular networks with deep Q learning approach,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.487857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.914367Z digest=sha256:842957225ac774324c79adb7483151b0aa75f88c5b07df379b92aa70ac9d51f5

Observation d86cf87a-3445-470b-a252-e99e5069f05f · outbound

This paper cites Joint power control and channel allocation for interference mitigation based on reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Joint power control and channel allocation for interference mitigation based on reinforcement learning,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.469648Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.919206Z digest=sha256:3ce9d8ff8a5af2ec2a8f0df1b7fa70ba5b9f4be7d6a7036a2f298a5519bbac71

Observation e896803b-aba4-4573-b966-ed5796e76b39 · outbound

This paper cites Deep actor-critic learning for distributed power control in wireless mobile networks,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Deep actor-critic learning for distributed power control in wireless mobile networks,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.447250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.923840Z digest=sha256:60f009a9cf0e2730f4c3b246d36bf023a9af971ab8362a23bb0c25681cf46e63

Observation a9e7afcb-a20d-4767-806d-f055c673c843 · outbound

This paper cites Deep reinforcement learning based wire- less network optimization: A comparative study,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Deep reinforcement learning based wire- less network optimization: A comparative study,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.429992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.928335Z digest=sha256:1f0e527abf28c259e2670b1de30f8f10b4b122db29e747a999bd422a50f11cc5

Observation 4a8fb1ba-fd12-4558-8c98-551e9435361f · outbound

This paper cites ColO- RAN: Developing Machine Learning-based xApps for Open RAN Closed-loop Control on Programmable Experimental Platforms,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management ColO- RAN: Developing Machine Learning-based xApps for Open RAN Closed-loop Control on Programmable Experimental Platforms,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.412476Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.933233Z digest=sha256:de30ecc5bea97b820bb88329b53c7a3897ac811c505e98e6415879276f8b5847

Observation 0efcb88b-4d34-4582-8df1-cf93c067722c · outbound

This paper cites FlexRAN: A flexible and programmable platform for software- defined radio access networks,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management FlexRAN: A flexible and programmable platform for software- defined radio access networks,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.396691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.938283Z digest=sha256:7dc242c0c982bdc8f79917e885889d4b2eac965e20cf23caace0a5e19c74018c

Observation 04d1d7ad-6a01-41cf-9b35-9849bb3fec9e · outbound

This paper cites Deep reinforcement learning for joint spectrum and power allocation in cellular networks,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Deep reinforcement learning for joint spectrum and power allocation in cellular networks,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.376074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.943681Z digest=sha256:af80bfc95de76e44d56fc02f04eb06d0e7f29a24bca86a67917d51a9a84cfc95

Observation 8c8a43ac-33d9-4d35-aeda-e0329a01963f · outbound

This paper cites Multi-agent deep reinforcement learning for dynamic power allocation in wireless networks,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Multi-agent deep reinforcement learning for dynamic power allocation in wireless networks,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.359596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.948386Z digest=sha256:e9c246d4fa2821eab51eed6b962fd12b15f2cfa094c0f2480e777de18ae80678

Observation abbb5159-d0a4-4f5a-a14c-376c7d667aa0 · outbound

This paper cites Multi- agent reinforcement learning for wireless user scheduling: Performance, scalablility, and generalization,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Multi- agent reinforcement learning for wireless user scheduling: Performance, scalablility, and generalization,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.340416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.953229Z digest=sha256:a34f55a224d32752c62d8efe58c9014656d2c72891204744a1fa4c5ad1f06de7

Observation 4786d838-3339-4a54-a55a-9d0ad12459ac · outbound

This paper cites Resource management in wireless networks via multi-agent deep reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Resource management in wireless networks via multi-agent deep reinforcement learning,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T20:58:02.958639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:58:02.958639Z digest=sha256:21d291c8df23cdaf92898f0c349236cf5d78c837809e60e2d48e39884dd2ac63

Observation 9f6fe38c-60b8-4321-a8e6-407c26949b68 · outbound

This paper cites Distributed MARL for scheduling in conflict graphs,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Distributed MARL for scheduling in conflict graphs,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.311863Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.963929Z digest=sha256:606f0dba9ab4535c020d90f01a44204b796d230071482ede3136af242ef9cada

Observation d2de51e2-2bdd-4ffa-9194-8accdc97981a · outbound

This paper cites Offline reinforcement learning for wireless network optimization with mixture datasets,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Offline reinforcement learning for wireless network optimization with mixture datasets,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.295227Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.970809Z digest=sha256:39bf4a7563cd0293d6fe48ba66e67ec85e220a6e4a8ab478e7c469661a25ba78

Observation 3daa3c11-e5c9-4b28-bc45-5af3768177b2 · outbound

This paper cites Advancing RAN slicing with offline reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Advancing RAN slicing with offline reinforcement learning,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.279124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.976751Z digest=sha256:f2767b32ed800449c0cd4cf252d737586c28c8d4c116b02df87135303e075028

Observation 0fc23e0a-4c89-4b71-abaf-532fb6834614 · outbound

This paper cites Mean-variance policy iteration for risk-averse reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Mean-variance policy iteration for risk-averse reinforcement learning,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.261064Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.982057Z digest=sha256:6d0b1f3350cc21fe2ca0b71d6e75186135e967929db2e89e10fc5e615979c628

Observation e0aed05d-01fa-49d7-8e9f-d6d13de8f23a · outbound

This paper cites Averaged-dqn: Variance reduc- tion and stabilization for deep reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Averaged-dqn: Variance reduc- tion and stabilization for deep reinforcement learning,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.243701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.987694Z digest=sha256:df90fefd69c1b934192dc9c27f453a1400ce44a6765f88a2c7383b3f083a15f7

Observation 38faea7d-0567-4d26-9138-308f0ede6ca3 · outbound

This paper cites Average-Reward Reinforcement Learning with Trust Region Methods.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Average-Reward Reinforcement Learning with Trust Region Methods

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-10T20:58:02.992888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:58:02.992888Z digest=sha256:fd38808ac273586f22a001cd52a5163870ce5dc37993003189addf800af86178

Observation 79263734-8de1-48bf-9c0d-79864f8f6157 · outbound

This paper cites The NS-3 network simulator,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management The NS-3 network simulator,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.224731Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:02.997779Z digest=sha256:dd3e9285362106702a933d3b96943a35db3a257ee748d4af5973daa1b4771ca2

Observation bf85f0c0-a91e-49a3-b59b-75d2d16428ae · outbound

This paper cites Network slicing architecture,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Network slicing architecture,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.206772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:03.002821Z digest=sha256:42d758eacc91cf037c0799e4b1ef8e66ddafd07d4d5a377f16e1ba66cfe8a023

Observation a0c4bc3e-559f-45c2-8445-4840f43886d2 · outbound

This paper cites NetworkGym: Democratizing Network AI via Sim-aaS,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management NetworkGym: Democratizing Network AI via Sim-aaS,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.188710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:03.007765Z digest=sha256:7d81333f9d1d19e47ac469f1d7c51922e5abb1a3c66527661ba2a3cf5f9af19f

Observation 77cd05a6-0482-4fbd-8745-f0df02bb77af · outbound

This paper cites Soft Actor-Critic Algorithms and Applications.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Soft Actor-Critic Algorithms and Applications

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T20:58:03.012480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:58:03.012480Z digest=sha256:3c61369af77f7e3c73fba881dd4ebfe1ac90859b0b9c333303088e064282d71e

Observation 75f746b8-3394-412e-9bdd-861ba0a638f8 · outbound

This paper cites A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms.

Average Reward Reinforcement Learning for Wireless Radio Resource Management A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-10T20:58:03.078406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:03.017617Z digest=sha256:43f2598000378244f3990cb628d23266aa6e19db8fee307f2d69195b09112428

Observation 8a8d116c-0e34-452f-9949-38b760fd7858 · outbound

This paper cites Revisiting the minimalist approach to offline reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Revisiting the minimalist approach to offline reinforcement learning,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.171997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:03.022995Z digest=sha256:b25c96007abbb94a629e4eb7a74850395537266be95bc4a5512ff7de02f9bb83

Observation 9bc0867d-2531-42e9-b963-a953fdb3ed79 · outbound

This paper cites Supported policy optimization for offline reinforcement learning,.

Average Reward Reinforcement Learning for Wireless Radio Resource Management Supported policy optimization for offline reinforcement learning,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:58:03.154181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-10T20:58:03.027593Z digest=sha256:61dbe31b697d5814c6fddaaf8a3e216c4021126cc5f395d358e9dd09e9e21174

Pith citing papers

No inbound Pith citation observations are available.