Pith. sign in

Paper Citation Record · LEDGER

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback

As of 13 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 4 inbound Pith citation observations for arXiv:2411.13410.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.13410 v1

Coverage vector

measured 83 of 83 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T16:30:09.564252Z

measured 87 of 87 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:49:31.040589Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-22T21:52:10.203651Z

Reference resolution

83 of 83 outbound references displayed

  • verified exact10
  • verified fuzzy35
  • unresolved38
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation dba0a613-d316-4f9d-b94a-a0cbe8c90065 · outbound

This paper cites Reinforcement learning in healthcare: A survey.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Reinforcement learning in healthcare: A survey

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.140900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.140900Z digest=sha256:5dfa66d646fad27eac46614b10f008b8d0c92ba31c57b7c885ac045c62d887f9

Observation ece67a6e-c4cb-43ec-8111-f4434523d3c8 · outbound

This paper cites Survey on reinforcement learning for language processing.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Survey on reinforcement learning for language processing

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.146819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.146819Z digest=sha256:dc479482d59ec44c49fcb54e8e182b0e848ea4a8c51553649be6aaed3e51430d

Observation d533b9b4-7d0f-4a14-823f-c0f7d05e0879 · outbound

This paper cites Recent advances in reinforcement learning in finance.Mathematical Finance, 33(3):437–503, 2023.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Recent advances in reinforcement learning in finance.Mathematical Finance, 33(3):437–503, 2023

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.152825Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.152825Z digest=sha256:76b1e3f356cf7bcbc14a08bb345fef590421d22d59e60bf896cf9b63d9e32a05

Observation b0a1a4b4-6abd-4a3b-8a96-033b2393db73 · outbound

This paper cites Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.159639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.159639Z digest=sha256:7731d70115a8c9a57ab486f15b71f11cbc49fa43e4e28c5439d988a051145df3

Observation 912ce50e-cab6-4bf8-aea1-874afb8b87fd · outbound

This paper cites A review on interactive reinforcement learning from human social feedback.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback A review on interactive reinforcement learning from human social feedback

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:11.106824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.165767Z digest=sha256:046f92203996582867ac59c35f8701739045e387fea77a05547fdafd6bbafd23

Observation 66592c6e-5ce4-451a-8cb7-a8ab2e6d2eaf · outbound

This paper cites Assessing Generalization in Deep Reinforcement Learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Assessing Generalization in Deep Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.171441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.171441Z digest=sha256:190e690df918c5271ec019106cfe04c4b12e362f863f0bc47e8cc07205851d24

Observation 8601ff7b-f855-4927-9ca3-e85480ff2dfb · outbound

This paper cites Latent exploration for reinforcement learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Latent exploration for reinforcement learning

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:11.089075Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.177910Z digest=sha256:09eded01ec0700fa2a858cf86f103ab8fed6dc22dfc0d0aa8ce238ae27576c90

Observation b3a785be-45c8-44f4-9892-1199dc287144 · outbound

This paper cites Reinforcement learning: A tutorial survey and recent advances.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Reinforcement learning: A tutorial survey and recent advances

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:11.071499Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.183094Z digest=sha256:0da277d11cf07106579fb1be6075d87d4c92b4842d8f557671c30f56d6d30c11

Observation 779a3c90-4ab6-443f-9b0b-c1e44a71992a · outbound

This paper cites A survey of reinforcement learning from human feedback.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback A survey of reinforcement learning from human feedback

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.188181Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.188181Z digest=sha256:a8decbabd15940020c2ce219dcdba2216d8c0901f59b531dc7729781308f9ac8

Observation 0af62018-f84e-4e15-9d07-0ce3d9c9c4aa · outbound

This paper cites The RL/LLM Taxonomy Tree: Reviewing Synergies Between Reinforcement Learning and Large Language Models.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback The RL/LLM Taxonomy Tree: Reviewing Synergies Between Reinforcement Learning and Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.193269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.193269Z digest=sha256:4c62e71068ba8a06f65b8c5daed685a8383e7bfb4153b57be1edcc1790fd7d03

Observation 7d1a0ee0-36f0-4ead-9e5e-827218367201 · outbound

This paper cites A conceptual framework for externally-influenced agents: An assisted reinforcement learning review.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback A conceptual framework for externally-influenced agents: An assisted reinforcement learning review

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:11.054062Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.199001Z digest=sha256:c5fd784818c0260b15db06cfe059693d57341ebeb794414867d32237348bff64

Observation 46328215-0d1b-4d7a-9e74-0cef46f6e311 · outbound

This paper cites Language as an abstraction for hierarchical deep reinforcement learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Language as an abstraction for hierarchical deep reinforcement learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.203986Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.203986Z digest=sha256:a7272e320713c6dd17cc5931afe2d6e8993fc2941d2c60876e064ae69a53ca46

Observation c50d11f1-13a8-4bcc-8131-573e4ad2724f · outbound

This paper cites Beating Atari with Natural Language Guided Reinforcement Learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Beating Atari with Natural Language Guided Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.209021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.209021Z digest=sha256:ac8330f03cf168251b7b0e1b1c10e8e6c9860ec823ce222d97c3a76d58acac79

Observation a70e08c7-be92-40b6-8ab9-ab4a73542ce1 · outbound

This paper cites The arcade learning environment: An evaluation platform for general agents.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback The arcade learning environment: An evaluation platform for general agents

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.214494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.214494Z digest=sha256:23172d74e699f18b9807c95c18a5b42c610e56f406eaa4defb377e6dc1de7204

Observation 9a960bfc-8359-4e6c-a399-c0d6a5c680fa · outbound

This paper cites Human Instruction-Following with Deep Reinforcement Learning via Transfer-Learning from Text.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Human Instruction-Following with Deep Reinforcement Learning via Transfer-Learning from Text

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.219431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.219431Z digest=sha256:0b71217e8426753e0fdfdb03c4bb45b22da180b691cec057b671abea0c053f2f

Observation 73d691cd-61f9-46eb-a063-a0b105de59da · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.224759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.224759Z digest=sha256:c70168ab6984b12c1eb3dea176b9c7fd4e85054720ecc75be6483e8c38e51131

Observation b09890bf-e265-4160-8ecb-8e33408dd0e4 · outbound

This paper cites Deep reinforcement learning for instruction following visual navigation in 3d maze-like environments.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Deep reinforcement learning for instruction following visual navigation in 3d maze-like environments

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:11.014083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.229941Z digest=sha256:57b5314487c1e8e10480097f575ce0234b8d3b9e9f483967c321afda910988e8

Observation 29ab2f82-cc7c-4ad6-81bd-1e3022f00a89 · outbound

This paper cites Learning to follow directions in street view.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Learning to follow directions in street view

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.996600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.235197Z digest=sha256:083afe29bce3beaaffa559e6f84734b15c1a026a3db577ea317cd0348004e353

Observation a596834c-90ed-4a55-9c85-5aae50cc25ce · outbound

This paper cites Language Instructed Reinforcement Learning for Human-AI Coordination.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Language Instructed Reinforcement Learning for Human-AI Coordination

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.240498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.240498Z digest=sha256:c7b3dfcac46e54b5f6212d0e2ff58c9eaac752a04201dc7f6e526fb55ca8b760

Observation c1a5feb8-1933-4169-828f-fe6ac8c498af · outbound

This paper cites Ask Your Humans: Using Human Instructions to Improve Generalization in Reinforcement Learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Ask Your Humans: Using Human Instructions to Improve Generalization in Reinforcement Learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.246540Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.246540Z digest=sha256:14161baf2e194bd3681c8b904c9b2a99899b4c0da8f1f935d482e3f2d8760a7e

Observation 8e1b405a-1831-4b81-9140-de686d30f9ce · outbound

This paper cites Meta-reinforcement learning via language instructions.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Meta-reinforcement learning via language instructions

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.978453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.253101Z digest=sha256:789a4b721a372faaa59c17e07775aff2321cb7a057ce6ca01d77fdca23c74bca

Observation ee46c1be-a28f-4b45-8c27-9803dbbf5d49 · outbound

This paper cites Guiding multi-step rearrangement tasks with natural language instructions.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Guiding multi-step rearrangement tasks with natural language instructions

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.961538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.258192Z digest=sha256:5c719f0975b6ce3d5ff95863d9402b93ac3f6389d67ac0515ad4fb79c3a29ae4

Observation 7a4ab7f4-e985-4296-ac73-e358b99baebd · outbound

This paper cites Interactive language: Talking to robots in real time.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Interactive language: Talking to robots in real time

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.263448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.263448Z digest=sha256:c7a3250bb540a8a7268d04327fad40975ee7549296c41f94ea071e4f1c028df8

Observation 9b1aa724-3810-4a16-9f40-3c5c97943700 · outbound

This paper cites Correcting Robot Plans with Natural Language Feedback.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Correcting Robot Plans with Natural Language Feedback

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.268493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.268493Z digest=sha256:e27fd608ecab8efa475df7e27b6b43b9bfb1d3688ffb8a7f8ee86e37f5eb5789

Observation 76f80baf-89aa-4716-99f8-0bdb7696f8ee · outbound

This paper cites Yell At Your Robot: Improving On-the-Fly from Language Corrections.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Yell At Your Robot: Improving On-the-Fly from Language Corrections

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.273639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.273639Z digest=sha256:219800d5065044ab6ab53e0bf3a4776ac51cc4b0f399ca72bf52cb21d90c6f23

Observation cb15ca3e-2973-418d-abc0-06094a7bcec3 · outbound

This paper cites Continual learning for instruction following from realtime feedback.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Continual learning for instruction following from realtime feedback

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.933736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.279021Z digest=sha256:d83bb0b7ad4f22a4899fd3af6e907bad2c1a01a1f7d66d71d8aec6121632939a

Observation 39ed1bf9-07e2-4e03-9a01-45f86e252ca8 · outbound

This paper cites Incorporating Voice Instructions in Model-Based Reinforcement Learning for Self-Driving Cars.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Incorporating Voice Instructions in Model-Based Reinforcement Learning for Self-Driving Cars

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-08-12T16:30:10.171097Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.284089Z digest=sha256:1e43c0c1bce2ba402b53eaad58b1962453a513bbad9f6f239c8c1a0e9350fd7e

Observation c60460ae-1e47-43a1-80d3-6f615e7e111e · outbound

This paper cites Correct me if i’m wrong: Using non-experts to repair reinforcement learning policies.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Correct me if i’m wrong: Using non-experts to repair reinforcement learning policies

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.917277Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.289195Z digest=sha256:82436ecc65b982246439781cc6c19bc67dd2fac2688fc71e5f5000e4e0b8cadb

Observation 8e969b6e-c6f5-4969-8125-a5ab2c57e84c · outbound

This paper cites Natural language specification of reinforcement learning policies through differentiable decision trees.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Natural language specification of reinforcement learning policies through differentiable decision trees

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.901053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.294309Z digest=sha256:8942dd2b432e62aead893551c57812b0932501704148835fd65f55ab8b6bb873

Observation 256d1d44-d0e8-43af-93a3-40baeece233f · outbound

This paper cites Ella: Exploration through learned language abstraction.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Ella: Exploration through learned language abstraction

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.884852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.299331Z digest=sha256:c05d048965e722d41477a7c54adee67470b6566995c6353f7de00e14e1d05e1f

Observation b95c84dd-6179-4bff-b851-c4812e8457e5 · outbound

This paper cites How to talk so ai will learn: Instructions, descriptions, and autonomy.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback How to talk so ai will learn: Instructions, descriptions, and autonomy

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.869554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.304137Z digest=sha256:4d40347bded158bbf716f3bb8ff740e6a9b77f85c6bc8087a960d15f3e5548a4

Observation 5f637c27-ecbd-438f-9027-04e95f7a3d5f · outbound

This paper cites Human-in-the-loop reinforcement learning in continuous-action space.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Human-in-the-loop reinforcement learning in continuous-action space

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.853608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.309243Z digest=sha256:11913d36b2ef4ce6cf5c9f2fcccea47bb32d70de46fd938b34811ac75cff0112

Observation 847d25fa-3f81-41ec-9bfd-71f1fa8c9a97 · outbound

This paper cites Toward human-in-the-loop ai: Enhancing deep reinforcement learning via real-time human guidance for autonomous driving.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Toward human-in-the-loop ai: Enhancing deep reinforcement learning via real-time human guidance for autonomous driving

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.837715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.314393Z digest=sha256:b55be43e30953c45fbe2188e98bd2e193feff5625647fc4d4010113fdd656bb5

Observation c4e0947a-1354-4e51-8642-cb1697bc091f · outbound

This paper cites Deep reinforcement learning with interactive feedback in a human–robot environment.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Deep reinforcement learning with interactive feedback in a human–robot environment

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.821705Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.319342Z digest=sha256:aabdcd011d386fcb3ab14820f418ec5abdf91f5c4acaf1c4bf9b398f88647fa3

Observation 169bccfd-1b74-4778-ab33-6c0468be2041 · outbound

This paper cites Deploying Offline Reinforcement Learning with Human Feedback.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Deploying Offline Reinforcement Learning with Human Feedback

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.324217Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.324217Z digest=sha256:2d61cb5056e9cc6152c39ece7d5826909a62abb287d6fe4a1bba289734ebf572

Observation 01f09b5c-e070-4ab6-974b-cbe59bf40f02 · outbound

This paper cites Widening the Pipeline in Human-Guided Reinforcement Learning with Explanation and Context-Aware Data Augmentation.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Widening the Pipeline in Human-Guided Reinforcement Learning with Explanation and Context-Aware Data Augmentation

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-08-12T16:30:10.128497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.329495Z digest=sha256:8a71741424d10cb346af199ece0c28f85a45a527806303d0577ddc6870bb8527

Observation 1b028d16-ebc7-447e-bf10-22de4c3437d7 · outbound

This paper cites The Expertise Problem: Learning from Specialized Feedback.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback The Expertise Problem: Learning from Specialized Feedback

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.334719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.334719Z digest=sha256:0c0fd7046c98d184dd668ccc57cd41ddb1f92c6e26eab46b61bfaa20b0fead19

Observation c270c114-4b55-4360-b264-6e99c2474bc8 · outbound

This paper cites Interactive reinforcement learning with bayesian fusion of multimodal advice.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Interactive reinforcement learning with bayesian fusion of multimodal advice

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.805105Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.340326Z digest=sha256:a776da53a19b6263a25ec3af4b226eb334762509f7e9d49ee43c6bfde3ff41ec

Observation 5d13a663-c34d-4dc8-831a-7a98553e55f5 · outbound

This paper cites Policy shaping: Integrating human feedback with reinforcement learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Policy shaping: Integrating human feedback with reinforcement learning

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.788784Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.345288Z digest=sha256:dafa3d75ca889ac0362122b3dbd187f39a970f74f5db0917aeadbd4ec8ef2b3f

Observation a23ad482-10bd-455c-95c3-3f305bb90669 · outbound

This paper cites Learning from unreliable human action advice in interactive reinforcement learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Learning from unreliable human action advice in interactive reinforcement learning

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.772213Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.349830Z digest=sha256:50fbbaff041da97b07df4395851fbf04c0c5348c29e03335cf7e671ef8586521

Observation d05e02e6-2cc2-4618-92db-d43c4a9ed02a · outbound

This paper cites Improving deep reinforcement learning in minecraft with action advice.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Improving deep reinforcement learning in minecraft with action advice

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.756048Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.354545Z digest=sha256:232381c25e27ba4405b2c469ccbd86040b4d5cf158b8dff2f607af3dbeed417e

Observation 2866a9f4-fa85-4bd3-b11e-4db6dd8d526a · outbound

This paper cites Advice-guided reinforce- ment learning in a non-markovian environment.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Advice-guided reinforce- ment learning in a non-markovian environment

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.739296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.359332Z digest=sha256:938766bf87565e360b85e060c1f154f462dd4c60008bc9726651962f81716db9

Observation 727e6e35-83aa-47d0-b91f-38fc10d6fabd · outbound

This paper cites Few-shot preference learning for human-in-the-loop rl.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Few-shot preference learning for human-in-the-loop rl

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.721309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.364431Z digest=sha256:dfde924087a0a17869fd20f3422421c989740a69fbf7760e1d8c1eda3eaa2f51

Observation c49ed6b2-728a-4f45-8e93-1f04123c2b18 · outbound

This paper cites Effect of human guidance and state space size on interactive reinforcement learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Effect of human guidance and state space size on interactive reinforcement learning

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.703129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.369211Z digest=sha256:d7280f5a8161930d538f372d1de6a97f7906b820248df9b1b96041bf62e267c7

Observation 029f2d92-f262-459b-9e30-d5e6821d0d38 · outbound

This paper cites Interactive reinforcement learning from demon- stration and human evaluative feedback.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Interactive reinforcement learning from demon- stration and human evaluative feedback

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.686721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.373872Z digest=sha256:11376083730156c6ee3b541bc2700f47e8e7ada4bc501e507f2180b191f985d8

Observation 21e5c316-b4eb-46b5-90db-7bfbba879e22 · outbound

This paper cites HAIM-DRL: Enhanced Human-in-the-loop Reinforcement Learning for Safe and Efficient Autonomous Driving.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback HAIM-DRL: Enhanced Human-in-the-loop Reinforcement Learning for Safe and Efficient Autonomous Driving

Reference 46

Resolution
verified exact
local_arxiv, observed 2026-08-12T16:30:10.084837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.378982Z digest=sha256:da9ac76ecd9033ba8e45be061d6fed32fd91c5414414a4a6171f49c026472461

Observation 2957aa46-575b-4285-b102-bf2f97ef7607 · outbound

This paper cites Tag: Teacher-advice mechanism with gaussian process for reinforcement learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Tag: Teacher-advice mechanism with gaussian process for reinforcement learning

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.669002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.384096Z digest=sha256:fe55cb185f0603fd82eb253d62ddafece5b532eb3b41e0d19c03980da3a49a1e

Observation 8a5396a2-821d-41da-9f83-8e1d8d724ee5 · outbound

This paper cites Guiding Pretraining in Reinforcement Learning with Large Language Models.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Guiding Pretraining in Reinforcement Learning with Large Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.389018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.389018Z digest=sha256:92a5669e01648b2f493f9e8b392b20d08050b97e39097f263b407466b3ea29e7

Observation b17fa341-a4f4-4a7e-8b96-6fc8542b7e17 · outbound

This paper cites Reinforcement Learning from LLM Feedback to Counteract Goal Misgeneralization.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Reinforcement Learning from LLM Feedback to Counteract Goal Misgeneralization

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.394349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.394349Z digest=sha256:14dd5fd2ed34c32abe4bc4459c6dd426f886249749ba33b790f20d52c6031357

Observation ac41e7ba-232f-4042-9c8d-586f17887e94 · outbound

This paper cites Mutual Enhancement of Large Language and Reinforcement Learning Models through Bi-Directional Feedback Mechanisms: A Planning Case Study.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Mutual Enhancement of Large Language and Reinforcement Learning Models through Bi-Directional Feedback Mechanisms: A Planning Case Study

Reference 50

Resolution
verified exact
local_arxiv, observed 2026-08-12T16:30:10.005234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.399338Z digest=sha256:142f3e691034aa54e21ce03abb3b0e09f15f909c5b50fb423508d30fdc7f2992

Observation 512c7b6e-1e6b-4c6e-a772-002df1cccb31 · outbound

This paper cites LaGR-SEQ: Language-Guided Reinforcement Learning with Sample-Efficient Querying.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback LaGR-SEQ: Language-Guided Reinforcement Learning with Sample-Efficient Querying

Reference 51

Resolution
verified exact
local_arxiv, observed 2026-08-12T16:30:09.979680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.404356Z digest=sha256:02f44a0de3efdcdf87f225d8e31f1b3b2f15ff5d8965f8f45dcfdc6b4201545f

Observation 2af37483-66ce-4409-ab30-92b282968b82 · outbound

This paper cites Reward Design with Language Models.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Reward Design with Language Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.409414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.409414Z digest=sha256:402ed7162b2201198700ae216a64c2e007dcb32958dc410bba39307c2774a1b8

Observation a787be6d-525b-4114-a43a-a193252556e8 · outbound

This paper cites Enabling Intelligent Interactions between an Agent and an LLM: A Reinforcement Learning Approach.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Enabling Intelligent Interactions between an Agent and an LLM: A Reinforcement Learning Approach

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.414132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.414132Z digest=sha256:ae234f9db134240adbbb1249fcd4e2053e8bc212e438769ef24013356c197380

Observation 95c2393c-dd4b-42f8-a8b0-f98d151fdfe4 · outbound

This paper cites Instruction-Following Agents with Multimodal Transformer.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Instruction-Following Agents with Multimodal Transformer

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.419058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.419058Z digest=sha256:9a1533c56f45e84f599ae0254c10a2e8c0386a637fbb514fb3a705f6f93c5123

Observation bbc52b58-0e77-42c8-8f21-4950f0d39a63 · outbound

This paper cites Eureka: Human-Level Reward Design via Coding Large Language Models.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Eureka: Human-Level Reward Design via Coding Large Language Models

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.423986Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.423986Z digest=sha256:d38d0522f42ba77e038a23e57f4a0b14e547e31ddbfe680fe3b9fd7cf50601e8

Observation 9a7c8c65-2cd9-4f15-984a-9c543c75ebd3 · outbound

This paper cites Inherently explainable reinforcement learning in natural language.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Inherently explainable reinforcement learning in natural language

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.651959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.429242Z digest=sha256:9128c18236e4807cb18806022869134ed49f6d0153f23b741c3bd58b74dfbe22

Observation a01f3d9c-208a-4b6e-8cb6-1fc9066e7e21 · outbound

This paper cites Multi-granularity Knowledge Transfer for Continual Reinforcement Learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Multi-granularity Knowledge Transfer for Continual Reinforcement Learning

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.434115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.434115Z digest=sha256:a372c381f1fc7e36135f2639d3da002a3c3c326c217e0f26193fe67057be92e0

Observation b96f90a6-1417-4d05-a595-cd4b91c98aa0 · outbound

This paper cites Motif: Intrinsic Motivation from Artificial Intelligence Feedback.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Motif: Intrinsic Motivation from Artificial Intelligence Feedback

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.439343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.439343Z digest=sha256:bdd7ee09f46b8a7359ab9306aea7c14147f4ef246ec8c354a43a6ae7b8a63010

Observation 67361466-daf3-4a45-9412-d24e78ee2ada · outbound

This paper cites Building Open-Ended Embodied Agent via Language-Policy Bidirectional Adaptation.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Building Open-Ended Embodied Agent via Language-Policy Bidirectional Adaptation

Reference 59

Resolution
verified exact
local_arxiv, observed 2026-08-12T16:30:09.851388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.444981Z digest=sha256:38973ed6b3fcc642f75655a9d3418d752c1b6e67ceffd83a15a4e294786b1c44

Observation 88801a12-9867-4e80-9afe-0cf8a0b72c20 · outbound

This paper cites LLM Augmented Hierarchical Agents.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback LLM Augmented Hierarchical Agents

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.450107Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.450107Z digest=sha256:c7cedd9e683913b828835e8122c9104c6469b03bc155a192c59069d48ee59b28

Observation 13809432-f3f1-4db0-a8a9-ac6aba334e4f · outbound

This paper cites Exploiting Contextual Structure to Generate Useful Auxiliary Tasks.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Exploiting Contextual Structure to Generate Useful Auxiliary Tasks

Reference 61

Resolution
verified exact
local_arxiv, observed 2026-08-12T16:30:09.807617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.455141Z digest=sha256:1c95ce5e605e24065b202fb28ce1270563b062a2a20d89a4c0e63c61fc66e92a

Observation b4c23225-a55b-4689-8944-cd924a87917b · outbound

This paper cites WorldCoder, a Model-Based LLM Agent: Building World Models by Writing Code and Interacting with the Environment.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback WorldCoder, a Model-Based LLM Agent: Building World Models by Writing Code and Interacting with the Environment

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.460266Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.460266Z digest=sha256:c5555f22bfcdaf9b9ce1ed48aed9e3286a07bcd35445441a23490cd597b8cef2

Observation 360aec97-ce14-46ed-a39b-77667414aa3b · outbound

This paper cites Natural Language Reinforcement Learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Natural Language Reinforcement Learning

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.465188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.465188Z digest=sha256:3eae7a28a17d65a560e076e2d96f926eacd7cf4d13134ca572d02d6a2769afdf

Observation fd84c2cd-df40-4453-9b7c-fb1d5bb418df · outbound

This paper cites LLM-Grounder: Open-Vocabulary 3D Visual Grounding with Large Language Model as an Agent.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback LLM-Grounder: Open-Vocabulary 3D Visual Grounding with Large Language Model as an Agent

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.469915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.469915Z digest=sha256:d85a930bd73d0440cf5c6de494d35c241c9405ded4d19bacbcfb45db39f1f107

Observation cdb33758-2b85-4dee-a750-e3d7e3b4d9bf · outbound

This paper cites Interactive planning using large language models for partially observable robotics tasks.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Interactive planning using large language models for partially observable robotics tasks

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.635323Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.474991Z digest=sha256:464b1e252290d28682652556f1d4942b762083bbf022e58f1f6bbf2c4a5b21ac

Observation 79446f17-6732-4ccc-8603-307651e85257 · outbound

This paper cites Grounding language to entities and dynamics for generalization in reinforcement learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Grounding language to entities and dynamics for generalization in reinforcement learning

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.479597Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.479597Z digest=sha256:4b9c0f7bdaacd5344cca097bbc8c97a6da261aa4318c29e5bd01fcc3ed74f2f9

Observation fa73d3af-1194-4100-ada5-28e8e6a8577d · outbound

This paper cites An End-to-End Approach to Natural Language Object Retrieval via Context-Aware Deep Reinforcement Learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback An End-to-End Approach to Natural Language Object Retrieval via Context-Aware Deep Reinforcement Learning

Reference 67

Resolution
verified exact
local_arxiv, observed 2026-08-12T16:30:09.729833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.484488Z digest=sha256:80a78b8106d20b8fea04c46015d7e9ff8c3cccddaf03ca998c9e9d0e53f06e28

Observation ac0ebf85-eb39-406a-8664-8a63ac6ca6ac · outbound

This paper cites Read, watch, and move: Reinforce- ment learning for temporally grounding natural language descriptions in videos.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Read, watch, and move: Reinforce- ment learning for temporally grounding natural language descriptions in videos

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.607279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.489542Z digest=sha256:793b60748850cd375f1e44aca8f60a146a11a763cd7d87a6e5a9efe9514d514c

Observation 35a08499-919a-45bd-bbd6-f3f4ab59f91b · outbound

This paper cites FollowNet: Robot Navigation by Following Natural Language Directions with Deep Reinforcement Learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback FollowNet: Robot Navigation by Following Natural Language Directions with Deep Reinforcement Learning

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.494305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.494305Z digest=sha256:611f780971a3a706c6c40f20fa9261137852afd64ea74d6b649f6aa4efe7ae3a

Observation afc2cbac-3051-456f-b4b0-b5c356d60cc8 · outbound

This paper cites Toward collaborative reinforcement learning agents that commu- nicate through text-based natural language.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Toward collaborative reinforcement learning agents that commu- nicate through text-based natural language

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.588539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.499208Z digest=sha256:c70d077719f46cfa3238024be8fa80b6dcd106d1f0cc10df09f633327dcd9a86

Observation 724d9902-8733-4cd3-9b5d-200ac32f8df3 · outbound

This paper cites Language Understanding for Text-based Games Using Deep Reinforcement Learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Language Understanding for Text-based Games Using Deep Reinforcement Learning

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.504494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.504494Z digest=sha256:9268f84ebc0bb737baa6e9e65506d6b6c87ea3da6645387685180fbc1265f053

Observation 8d3c351d-cb10-41c4-bb72-f09f8bdbe6a2 · outbound

This paper cites Towards End-to-End Learning for Dialog State Tracking and Management using Deep Reinforcement Learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Towards End-to-End Learning for Dialog State Tracking and Management using Deep Reinforcement Learning

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.509653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.509653Z digest=sha256:0abd9809f9c2050afc7c0804b26d8804efd89dcee500779d8d631dedb65d7524

Observation b7c04b73-a88e-4a6e-8b1a-be83bb9bcb87 · outbound

This paper cites Online learning of task-driven object-based visual attention control.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Online learning of task-driven object-based visual attention control

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.570271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.515290Z digest=sha256:1a116f026a234af5826f875f2c575a15b4f62b4cf9ce27e29e0f60d75b792eab

Observation 5733aa7f-01a7-484e-abd7-f2a68823abae · outbound

This paper cites Visual navigation with spatial attention.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Visual navigation with spatial attention

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.553675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.520218Z digest=sha256:2fd4cd359ebddc58c90fc8a2ab7806f095fa8c6c7d417f58ba2b25194542dea8

Observation b076e219-691e-4e3f-b6c9-29155909665a · outbound

This paper cites An Actor-Critic-Attention Mechanism for Deep Reinforcement Learning in Multi-view Environments.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback An Actor-Critic-Attention Mechanism for Deep Reinforcement Learning in Multi-view Environments

Reference 75

Resolution
verified exact
local_arxiv, observed 2026-08-12T16:30:09.655196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.525348Z digest=sha256:73b53584f4f5859f19de2df2bc861ee4750cada9b217e37363db2422fc75ab17

Observation 27dd67a0-3297-43e6-86c8-849f1a11c98c · outbound

This paper cites Deep reinforcement learning for the dynamic and uncertain vehicle routing problem.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Deep reinforcement learning for the dynamic and uncertain vehicle routing problem

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.536718Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.530713Z digest=sha256:2b6e21138eb77aca728675fbd62df613bbef242fb85280c96edc8fd734b42b9b

Observation 0845676b-cf2f-4ef2-b5fd-3e371c79aff2 · outbound

This paper cites Optimizing attention for sequence modeling via reinforcement learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Optimizing attention for sequence modeling via reinforcement learning

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.519876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.535716Z digest=sha256:262dd716429464580daef56219756bf468303977a9abdcc15abf0bbd138c35e9

Observation 88eef297-5419-4bc3-a90a-18c1be411750 · outbound

This paper cites Attention-based curiosity-driven exploration in deep reinforcement learning.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Attention-based curiosity-driven exploration in deep reinforcement learning

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.500629Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.540476Z digest=sha256:5d6a929dffeec4131376e26f2d2473e2ca8d68bccede398d55ff642b7da869ec

Observation 9a4af098-f314-4e1a-ba64-8eab09b5eff4 · outbound

This paper cites Towards interpretable reinforcement learning using attention augmented agents.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Towards interpretable reinforcement learning using attention augmented agents

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.545147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.545147Z digest=sha256:10364d3bc4ddd4ac9349b7bf452560b163a6d23a88034f3a567acf832df43486

Observation ddf6d89f-d111-44ab-b51c-c240eb8f4f33 · outbound

This paper cites Dynamic interaction between reinforcement learning and attention in multidimensional environments.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Dynamic interaction between reinforcement learning and attention in multidimensional environments

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-12T16:30:10.472088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.549870Z digest=sha256:728f6a6aed6b3a29c111529ba6a6bdf27822e49dbe561e2bbf645805ed084b5b

Observation e8d1eed7-bf4d-44e6-9e14-4f2f75b986e6 · outbound

This paper cites Machine versus Human Attention in Deep Reinforcement Learning Tasks.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Machine versus Human Attention in Deep Reinforcement Learning Tasks

Reference 81

Resolution
verified exact
local_arxiv, observed 2026-08-12T16:30:09.631134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-12T16:30:09.554515Z digest=sha256:45c42452b76bdcd641944f02132b31b2421a153db2cc2873f560bb6f821b0e68

Observation 795964a7-88a7-48ac-97f3-32d491dffb94 · outbound

This paper cites Rt-2: Vision-language-action models transfer web knowledge to robotic control.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Rt-2: Vision-language-action models transfer web knowledge to robotic control

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.559362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.559362Z digest=sha256:1fbbd739830e1432fc49144715b778461c52f3bb6966ce5619d4d38da4e6e1e7

Observation 9725d750-cd2b-41ce-a8e4-df3bf1b13276 · outbound

This paper cites MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.564252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.564252Z digest=sha256:5be00dc65fa25bab2b0210ae700e090775a873cc6ca2527de910e96bc492189d

Pith citing papers

Observation 9faa6ac4-da25-47ec-a49f-093ca02ed54f · inbound

Large Language Model Agent: A Survey on Methodology, Applications and Challenges cites this paper.

Large Language Model Agent: A Survey on Methodology, Applications and Challenges A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback

Reference 112

Resolution
verified exact
arxiv_id, observed 2026-05-22T21:52:10.206920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-22T21:51:34.309870Z digest=sha256:c610b7e58b2757b4c17ab6f2e2177447a54c16d1930ecc670d721739391bdf6e

Observation 8f4ded18-1345-48f0-99d2-3ef83c081391 · inbound

MARCO: Meta-Reflection with Cross-Referencing for Code Reasoning cites this paper.

MARCO: Meta-Reflection with Cross-Referencing for Code Reasoning A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:49:31.040589Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:49:31.040589Z digest=sha256:e4c5a39f5ce4829a49b5b08e552fb2157941e9277636d546ec250d4f72b8696a

Observation 693244ae-1063-432e-a529-52d44d492358 · inbound

LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation cites this paper.

LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T13:53:38.995783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:53:38.995783Z digest=sha256:fe5ac10e646a3c9cacb740c09864cb0145868c7ae93582122a977ab1686e6fa4

Observation 2af1b1a6-5461-4764-9987-518e640f6b4c · inbound

Evaluation of LLMs for mathematical problem solving cites this paper.

Evaluation of LLMs for mathematical problem solving A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T12:11:03.514978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:11:03.514978Z digest=sha256:78cb8479c66d20e53fb509e5971d08f871504811ddbe828657e38ca10550eb07