Pith. sign in

Paper Citation Record · LEDGER

Enhancing Decision-Making of Large Language Models via Actor-Critic

As of 16 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2506.06376.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.06376 v1

Coverage vector

measured 64 of 64 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T10:55:44.534042Z

measured 64 of 64 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

64 of 64 outbound references displayed

  • verified exact2
  • verified fuzzy26
  • unresolved36
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8545f206-1b6b-4f21-a513-9e004cf2015a · outbound

This paper cites GPT-4 Technical Report.

Enhancing Decision-Making of Large Language Models via Actor-Critic GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.248408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.248408Z digest=sha256:ba24bc0f6d6c7a40683aca872935045442630d106628d6536a7c27c3adf94c31

Observation 975e3704-223f-425f-a56b-12dfa3596532 · outbound

This paper cites G., Sutton, R.

Enhancing Decision-Making of Large Language Models via Actor-Critic G., Sutton, R

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.151052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.251820Z digest=sha256:e5bcbaeb86f53a76fe1d20086c46dbec840b8021c9d84954717e4fb0e85024cf

Observation 2168a1e0-8dd4-455f-9f7b-18017c98c202 · outbound

This paper cites L., and Singh, S.

Enhancing Decision-Making of Large Language Models via Actor-Critic L., and Singh, S

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.142798Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.255161Z digest=sha256:a8c3a67cba96f3f410bf87a0f05b8b6585f143689f0450f574ccaccf7a64a9f9

Observation b7f2a298-d835-4bd1-af34-06a57bb0be0e · outbound

This paper cites The computational complexity of propositional strips planning.

Enhancing Decision-Making of Large Language Models via Actor-Critic The computational complexity of propositional strips planning

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.133991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.258099Z digest=sha256:15c62ce062cd9e3420d5d3937f581d4da24a0565c089bab39403cf7cc31787fb

Observation dd9d9076-8045-41db-8410-883e6b4081fd · outbound

This paper cites Grounding large language models in interactive environments with online reinforcement learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic Grounding large language models in interactive environments with online reinforcement learning

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.124847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.261230Z digest=sha256:f8dcd859d399c968dc080816231bddbcf5ea2afd0b3dd6bad86f628e6375a308

Observation 59c50699-e384-45a9-acfe-58921f6706d3 · outbound

This paper cites Grounding large language models in interactive environments with online reinforcement learning, 2023 b.

Enhancing Decision-Making of Large Language Models via Actor-Critic Grounding large language models in interactive environments with online reinforcement learning, 2023 b

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.115918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.264183Z digest=sha256:f7aa172c4746a5f5a89af80dc7c16fc5eaf1595d9dbb8882eca5b638db406ba6

Observation 77a7d3de-3672-4db1-bbcd-0534a24b3157 · outbound

This paper cites Decision transformer: Reinforcement learning via sequence modeling.

Enhancing Decision-Making of Large Language Models via Actor-Critic Decision transformer: Reinforcement learning via sequence modeling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.267264Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.267264Z digest=sha256:b98529003eb941d5b6d7cf0df54675ca8c044c0574e6120ffb409643f726d20e

Observation ebaae906-8f3d-45cc-b8ea-90587c083b3a · outbound

This paper cites BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.269879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.269879Z digest=sha256:df39d27231d50b335dbee09f12709d6b933b6895f945fd747b735cf24554356a

Observation ab4c0389-bc79-472f-bb80-913288a16547 · outbound

This paper cites Efficient selectivity and backup operators in monte-carlo tree search.

Enhancing Decision-Making of Large Language Models via Actor-Critic Efficient selectivity and backup operators in monte-carlo tree search

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.101508Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.272705Z digest=sha256:2a503dfca14989037c08b5064528cdbeadc8f1c130672698bbf22b2073d14ebe

Observation 273a0c2d-3aa1-46e3-917f-7a4d294b61ee · outbound

This paper cites The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks.

Enhancing Decision-Making of Large Language Models via Actor-Critic The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.275248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.275248Z digest=sha256:e06c0664800e60468f70bbc3f2f183f56d48e33c758c88332e338afa7a566cff

Observation e6b75a92-a039-4a5c-b076-ea2abdecd9b8 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.278393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.278393Z digest=sha256:0885f24384b1e94919bc808eaee38be63c2e79f52a9ad068018870500fa55344

Observation 4bd6fbee-d000-4806-ac94-da470ee7782e · outbound

This paper cites Task and motion planning with large language models for object rearrangement.

Enhancing Decision-Making of Large Language Models via Actor-Critic Task and motion planning with large language models for object rearrangement

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.092899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.281136Z digest=sha256:5bc73521f8ad31a1191e717dc84226f374f2f8dfa964ad5cafa906643348d0e1

Observation 06fd3275-af0c-40da-9583-c506bf321a1f · outbound

This paper cites Low-rank modular reinforcement learning via muscle synergy.

Enhancing Decision-Making of Large Language Models via Actor-Critic Low-rank modular reinforcement learning via muscle synergy

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.083971Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.283993Z digest=sha256:1d1dc4b0303f6ac44ca6d6dc20d2fa4948aebdf6e4336b65822facd0c09dc412

Observation fde0f198-05f3-43e7-8456-d66dcd5d460c · outbound

This paper cites PreAct: Prediction Enhances Agent's Planning Ability.

Enhancing Decision-Making of Large Language Models via Actor-Critic PreAct: Prediction Enhances Agent's Planning Ability

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-08-07T10:55:44.767850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.286512Z digest=sha256:f91741524cdd9ac4d9c5a3ba51ed68356de8c9e441b40a7529423102353d097e

Observation 62c6fff1-2d4d-4c47-96ec-20ee9e47d33c · outbound

This paper cites Addressing function approximation error in actor-critic methods.

Enhancing Decision-Making of Large Language Models via Actor-Critic Addressing function approximation error in actor-critic methods

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.289495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.289495Z digest=sha256:81403b0b583fb6975acc248b4ae3128682b05c4841ffe581fb2280386cd67b79

Observation edc425d8-0a9b-413f-aa1c-6f753ce0daea · outbound

This paper cites Aligning language models with preferences through f -divergence minimization.

Enhancing Decision-Making of Large Language Models via Actor-Critic Aligning language models with preferences through f -divergence minimization

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.069984Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.292179Z digest=sha256:facdf7495c1bd882bb490683345e0362a31915fec8bc0fc69fc76e743026eb55

Observation 2ac67d04-99fa-490c-9ed6-559499e0f2bc · outbound

This paper cites Benchmarking the spectrum of agent capabilities.

Enhancing Decision-Making of Large Language Models via Actor-Critic Benchmarking the spectrum of agent capabilities

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.061015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.294660Z digest=sha256:574ff5c1cd0b49b5de497d54be13edd5d8e4cc3837ae635fa1149aed00ee4a17

Observation f79bef7e-05f9-42d3-b19d-2cb02e04ca24 · outbound

This paper cites Reasoning with language model is planning with world model.

Enhancing Decision-Making of Large Language Models via Actor-Critic Reasoning with language model is planning with world model

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.297209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.297209Z digest=sha256:62f550c533e334eaa5dfe21ef4d9869e98b4feec329b59c6d5cff8554bf8b89b

Observation 9e9defb4-19ea-4433-b16f-14bfa5b8bebc · outbound

This paper cites J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W.

Enhancing Decision-Making of Large Language Models via Actor-Critic J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.300066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.300066Z digest=sha256:211a5b9a1bfa1f5b2e238cf9a779517ad028e318c30ef559c2bf022707a3a4e9

Observation 83373baa-7c68-4e5b-8faf-e54c545eef5d · outbound

This paper cites Towards Reasoning in Large Language Models: A Survey.

Enhancing Decision-Making of Large Language Models via Actor-Critic Towards Reasoning in Large Language Models: A Survey

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.302536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.302536Z digest=sha256:608cb5ac15d5b4a8059a1a501fa528874f0d938c09c97668f799fe3036028dc7

Observation 48bf0bc7-2a31-4f5f-9ece-ee18bb0f71ae · outbound

This paper cites One policy to control them all: Shared modular policies for agent-agnostic control.

Enhancing Decision-Making of Large Language Models via Actor-Critic One policy to control them all: Shared modular policies for agent-agnostic control

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.046114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.305625Z digest=sha256:1bcfa56f17f5e647df1c936a23bfdb315e85aa2d6be67e2ae45c0127c2598848

Observation c654ec8b-8bc6-4ae6-b158-f6bab095a8d6 · outbound

This paper cites Language models as zero-shot planners: Extracting actionable knowledge for embodied agents.

Enhancing Decision-Making of Large Language Models via Actor-Critic Language models as zero-shot planners: Extracting actionable knowledge for embodied agents

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.037344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.308201Z digest=sha256:2af06ee826889701fb9f65c4452026602ccf89d5c39912aaa57e47cf9cdfb3d2

Observation 5b95ead7-6844-4ec6-9344-38c735df3674 · outbound

This paper cites Inner Monologue: Embodied Reasoning through Planning with Language Models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Inner Monologue: Embodied Reasoning through Planning with Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.310610Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.310610Z digest=sha256:f56188e622cd67cb5afc78cca21f0bef749aadb5ebf40334e278b21af1c22843

Observation f85e32c8-2672-4350-b218-7b57feb692c0 · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:45.028202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.313193Z digest=sha256:df9b78e261c5aa38157397e5da16c84fe76ab3af40a6f2ff495596c68573c316

Observation f5e38c5e-38e8-475c-a4eb-10f94397855f · outbound

This paper cites Learning trajectory preferences for manipulators via iterative improvement.

Enhancing Decision-Making of Large Language Models via Actor-Critic Learning trajectory preferences for manipulators via iterative improvement

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.019246Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.315854Z digest=sha256:e5dd7c9ab23a3d0695d3695409f2aa5726858372c1cb7bca54a79b14542fd338

Observation e3497c31-e362-41c9-85e0-4957d8befcd4 · outbound

This paper cites Mistral 7B.

Enhancing Decision-Making of Large Language Models via Actor-Critic Mistral 7B

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.318509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.318509Z digest=sha256:1b501ce0b74c042f07cd38c64944aedb5eb035ac2136e957220dc717f1a025f9

Observation 35d14291-865b-47b3-bc22-8e4d096f8785 · outbound

This paper cites A comprehensive survey on process-oriented automatic text summarization with exploration of llm-based methods.

Enhancing Decision-Making of Large Language Models via Actor-Critic A comprehensive survey on process-oriented automatic text summarization with exploration of llm-based methods

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.322888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.322888Z digest=sha256:9f8e5e2e89472ffb0339144a8636acc7326780032aa6e418f7ab63b41a3e8eee

Observation ec19ea2e-4a17-4001-aefa-b0986b28b35a · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:45.010508Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.325521Z digest=sha256:27ea1b5662055e73af252d416f898b58e710f459dca33f5a5db4c30a3601b352

Observation e0343ef6-cb72-4f1d-ae60-525af75069d9 · outbound

This paper cites and Szepesv \'a ri, C.

Enhancing Decision-Making of Large Language Models via Actor-Critic and Szepesv \'a ri, C

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.328311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.328311Z digest=sha256:c55013456b0ed479853218d0a1a7f5fddcd1f1e99cd05310b0c7ccb79436658d

Observation 7908c0e6-fd04-48d2-ad92-4408d6c67248 · outbound

This paper cites Y., McAleer, S., Fried, D., and Salakhutdinov, R.

Enhancing Decision-Making of Large Language Models via Actor-Critic Y., McAleer, S., Fried, D., and Salakhutdinov, R

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.331022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.331022Z digest=sha256:95fb78daf8f816e7eed7e521134e96e354f016fb9b928bc5ee1381a216252ed0

Observation a814a2f7-f3ec-4560-8c0a-c83797b52dba · outbound

This paper cites S., Reid, M., Matsuo, Y., and Iwasawa, Y.

Enhancing Decision-Making of Large Language Models via Actor-Critic S., Reid, M., Matsuo, Y., and Iwasawa, Y

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.333655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.333655Z digest=sha256:b66ef1a22e2d152b9e665d5f4088e915b40189c01313ed335c2cdc92a99f123e

Observation 277a3b96-7b11-488d-a7dd-1ca7ca2b1ddf · outbound

This paper cites X., Nie, J.-Y., and Wen, J.-R.

Enhancing Decision-Making of Large Language Models via Actor-Critic X., Nie, J.-Y., and Wen, J.-R

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.336377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.336377Z digest=sha256:ccf79f274620ea935a45255602c39f88792ae7cb7fe597b808b0391f2a9de2be

Observation 0e2da5ce-f74c-4a6f-a709-c5dff6fbc904 · outbound

This paper cites Unigen: A unified generative framework for retrieval and question answering with large language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unigen: A unified generative framework for retrieval and question answering with large language models

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.989911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.339233Z digest=sha256:ae1294c4aea66e55a20d1cd366631079f1bf7b25c02efccd6d4684e9a4fbf348

Observation b7fbf1c0-8cf3-49f5-911c-b7e59b01d496 · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:44.980324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.341658Z digest=sha256:776b8925c3522f671a02df891a2ebf09bbaccbc32cad8c7e8a244059f346a9d5

Observation 01e787f9-0c88-42d5-a948-b9bf48de9b7d · outbound

This paper cites Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency.

Enhancing Decision-Making of Large Language Models via Actor-Critic Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.457704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.457704Z digest=sha256:358691d64e05665bdd3f99d3b91a60535ca0faac87252b83f39de576c42119c7

Observation 2f8d07c3-a60c-4d34-9168-bb15616861af · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:44.971943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.461051Z digest=sha256:d647c69f4d8801cb47eb4962f901e6354b682a18d49de11d9c021798e066b302

Observation 0ad159a1-a689-4cae-8e10-972e31afba8c · outbound

This paper cites Meta llama 3.

Enhancing Decision-Making of Large Language Models via Actor-Critic Meta llama 3

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.963613Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.463872Z digest=sha256:1a989743eacb0e485568b972cf821f054ece30af1a196dc5abec59cd70185771

Observation ed997408-8027-44f6-a260-2ff357ba1bc8 · outbound

This paper cites Meta llama 3.1.

Enhancing Decision-Making of Large Language Models via Actor-Critic Meta llama 3.1

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.954996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.466393Z digest=sha256:5ad56d8f277e03b97301135acb11a2a54cd0ef5b0e92a8fc6bdd6ee441e0695c

Observation bd9417d3-9dc8-451f-a888-91afc3a7b70b · outbound

This paper cites Augmented language models: a survey.

Enhancing Decision-Making of Large Language Models via Actor-Critic Augmented language models: a survey

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.946264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.469037Z digest=sha256:ea198e5f4023b1a773a12f41bd7d0dda070e5db050144eb0793043064f18d935

Observation 163cc2d4-c4e2-49bd-93c3-61050bed5f00 · outbound

This paper cites BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games.

Enhancing Decision-Making of Large Language Models via Actor-Critic BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.471737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.471737Z digest=sha256:8aa1ec942d420fbbbfeddc8779038fbce6e46c13bd8d8a22b454d4a0070d8d8e

Observation 4a91ba41-5412-4b3a-ba82-1d372584acd4 · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.474500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.474500Z digest=sha256:47f99b0dfc38fe7dcfa5707d4479b03241c2699fc45b5754f2c5236c8536bc9a

Observation 319de725-a390-4093-921c-24f013875939 · outbound

This paper cites and Schaal, S.

Enhancing Decision-Making of Large Language Models via Actor-Critic and Schaal, S

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.477102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.477102Z digest=sha256:ff2bc79d6c7821e1f7222a6d5b62b5c452d9a33734673f4a2cd7951b6ad3efe1

Observation c34eb28c-b6bf-4581-9945-4535d81cb2d0 · outbound

This paper cites Why think step by step? reasoning emerges from the locality of experience.

Enhancing Decision-Making of Large Language Models via Actor-Critic Why think step by step? reasoning emerges from the locality of experience

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.932022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.479697Z digest=sha256:bca14382d9be5ff43f1a6f64ae6da43e0a571123d069701681527f40fbc8d4e8

Observation 01743166-a593-4771-a463-4a15f7212bfb · outbound

This paper cites D., Ermon, S., and Finn, C.

Enhancing Decision-Making of Large Language Models via Actor-Critic D., Ermon, S., and Finn, C

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.482320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.482320Z digest=sha256:52ddfe3c4a2a06592cc9a2d863cb7af1834aaaef5a8f6162267272532023bcb0

Observation ea598e5b-acc9-4028-9028-af4d1cf71160 · outbound

This paper cites Code Llama: Open Foundation Models for Code.

Enhancing Decision-Making of Large Language Models via Actor-Critic Code Llama: Open Foundation Models for Code

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.484816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.484816Z digest=sha256:560608b24e1166bb37355dbdc050fc8ba14911671ce460af02a521a8169d6559

Observation 8e6f3dd8-db1b-4ce5-a1d0-25429639149e · outbound

This paper cites Proximal Policy Optimization Algorithms.

Enhancing Decision-Making of Large Language Models via Actor-Critic Proximal Policy Optimization Algorithms

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.487555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.487555Z digest=sha256:11e6da708bf177574e3db2be7c10e12dd56fae706ce06b76bf3e90fbe04a720e

Observation e4682510-9830-4f2a-a729-038bd34ddb05 · outbound

This paper cites Reflexion: Language agents with verbal reinforcement learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic Reflexion: Language agents with verbal reinforcement learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.490111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.490111Z digest=sha256:40b58b2ec689b170373af631dc4049934a5175f14840cfd555093303e2eecddc

Observation 11b55e9a-8dea-4083-838c-dd7cd39ad867 · outbound

This paper cites Alfred: A benchmark for interpreting grounded instructions for everyday tasks.

Enhancing Decision-Making of Large Language Models via Actor-Critic Alfred: A benchmark for interpreting grounded instructions for everyday tasks

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.912098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.492701Z digest=sha256:7e7c54cdfe8f8252951953c187843f6e61cb2ff28b460e57e358d14e5b141d4f

Observation e74a8459-b34b-490b-9a65-a0024ebd13d6 · outbound

This paper cites Alfworld: Aligning text and embodied environments for interactive learning, 2021.

Enhancing Decision-Making of Large Language Models via Actor-Critic Alfworld: Aligning text and embodied environments for interactive learning, 2021

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.903299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.495003Z digest=sha256:6b1baf36ade9dfb08f0597f95ab89f8e1e98ed29af69c0d3757b33882e9f716a

Observation 56c293c6-26b3-47ea-9086-c8aed55075a0 · outbound

This paper cites Progprompt: Generating situated robot task plans using large language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Progprompt: Generating situated robot task plans using large language models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.497377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.497377Z digest=sha256:8ba73dcc20f1defa4d1c199ec75731b7af2821530ccaff0520e4e39eb243071b

Observation 17417333-0912-4f74-9e50-becfb8978e61 · outbound

This paper cites D., and Toshev, A.

Enhancing Decision-Making of Large Language Models via Actor-Critic D., and Toshev, A

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.888314Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.500183Z digest=sha256:3f6edd1572ba997442c2f75450ae590ed6161b135af0976295594858cd86d632

Observation 61495bfc-42c5-491c-80ea-76d0aeb7f3f2 · outbound

This paper cites True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.879712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.502726Z digest=sha256:ed351bf35195a0d7e2c982eeace5e919b634cdb43f45c97b0f8fff3e93b8bf46

Observation ac4d6994-e8ea-49eb-8f2b-cbe00d981b26 · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Enhancing Decision-Making of Large Language Models via Actor-Critic Gemma: Open Models Based on Gemini Research and Technology

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.505310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.505310Z digest=sha256:a4118f136d0ff5f9032f8edaa294aab17ad3fcc9a973d0b8868a9be3d23d2524

Observation b02096e9-2c90-4cbc-b0a8-ea3568ddbafb · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.508021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.508021Z digest=sha256:22277fc1a35c36b9f6e9a9fab25f68194e4c2a9cf419bcfe8d5a12ab6a0b69d9

Observation d73eeb31-a55b-4e02-8247-df8e1f2f7128 · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:44.870756Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.510775Z digest=sha256:32e8cd59d004d8dd327f1d8ce4c2ba787b93a9b2f3de5525c1cc2f5b8d9cf137

Observation c25f6ddd-dc09-48d4-9350-8e3d25bdb74e · outbound

This paper cites V., Zhou, D., et al.

Enhancing Decision-Making of Large Language Models via Actor-Critic V., Zhou, D., et al

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.513182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.513182Z digest=sha256:7c354dd4c3cdbbdc73bcb1d0be42059758dda4b5dfcb3efaa303b6c812af28f9

Observation c8d8e698-062d-48b7-88b1-95778729ebe5 · outbound

This paper cites Webshop: Towards scalable real-world web interaction with grounded language agents.

Enhancing Decision-Making of Large Language Models via Actor-Critic Webshop: Towards scalable real-world web interaction with grounded language agents

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.515658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.515658Z digest=sha256:87f7a06a2854c91d869b14d89500dd76123a73a8b1e7c34f8aca7ba30d85c967

Observation 42b7e1e6-0945-4541-b622-0bf63df593cc · outbound

This paper cites React: Synergizing reasoning and acting in language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic React: Synergizing reasoning and acting in language models

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.518179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.518179Z digest=sha256:d75ea773588d97c4b0187ab7e4baab790a9338ab68d62292731440e25f293ea1

Observation 64947bb9-e6d6-4e8f-923c-7162fe407f26 · outbound

This paper cites C., Liu, Z., Feng, Y., Xue, L., Rithesh, R., Chen, Z., Zhang, J., Arpit, D., et al.

Enhancing Decision-Making of Large Language Models via Actor-Critic C., Liu, Z., Feng, Y., Xue, L., Rithesh, R., Chen, Z., Zhang, J., Arpit, D., et al

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.844499Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.520944Z digest=sha256:94bf0cc39c6c62f745a09569cb9de2c31e01275fd254789308387dd9a1633e5e

Observation 472a3cc8-de4a-4b05-8766-b80fb2efa25a · outbound

This paper cites Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach.

Enhancing Decision-Making of Large Language Models via Actor-Critic Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach

Reference 60

Resolution
verified exact
local_arxiv, observed 2026-08-07T10:55:44.581052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.523696Z digest=sha256:23405b227836a3357e6fa5c0677c7594b491d2269636df57d0e4b946b19fddf3

Observation b77abfaa-bc0b-4880-bf6b-be5f5fbb1df1 · outbound

This paper cites Large language models are semi-parametric reinforcement learning agents.

Enhancing Decision-Making of Large Language Models via Actor-Critic Large language models are semi-parametric reinforcement learning agents

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.835461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.526453Z digest=sha256:7fa87bd473726ad6f4aa5bed2aea88b90bf0a6a174ee885a734139a9d06970b6

Observation b27d00e7-f66f-454a-b8f4-507347a539f5 · outbound

This paper cites Language agent tree search unifies reasoning, acting, and planning in language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Language agent tree search unifies reasoning, acting, and planning in language models

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.827040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.529045Z digest=sha256:4b4c10a14939512c4ddb0677ad48b8841b72165443628bf7893ec036854cc1bb

Observation 1d16ed95-0271-4c05-b3a7-166c87a4cd8f · outbound

This paper cites Archer: Training language model agents via hierarchical multi-turn rl.

Enhancing Decision-Making of Large Language Models via Actor-Critic Archer: Training language model agents via hierarchical multi-turn rl

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.818408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.531578Z digest=sha256:7dfddd8aa7b080e9fc82e020388d9426adebc56d6ce8a2c0e1e63a15fc7db9f1

Observation f1c2c3a5-e6c6-4360-8658-418e81908b5b · outbound

This paper cites write newline.

Enhancing Decision-Making of Large Language Models via Actor-Critic write newline

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.534042Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.534042Z digest=sha256:dad32827e3d4fb44f678f96a69e71bc3f8c2e57c7e2e4c477d7a2a34ad95b6e0

Pith citing papers

No inbound Pith citation observations are available.