Pith. sign in

Paper Citation Record · LEDGER

Enhancing Decision-Making of Large Language Models via Actor-Critic

As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2506.06376.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.06376 v1

Coverage vector

measured 64 of 64 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T10:55:44.534042Z

measured 64 of 64 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

64 of 64 outbound references displayed

  • verified exact2
  • verified fuzzy26
  • unresolved36
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8545f206-1b6b-4f21-a513-9e004cf2015a · outbound

This paper cites GPT-4 Technical Report.

Enhancing Decision-Making of Large Language Models via Actor-Critic GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.248408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.248408Z digest=sha256:0fe59101d4e9a93affd3465b61ec5d110428f599447c7fd0d56f1888749209ed

Observation 975e3704-223f-425f-a56b-12dfa3596532 · outbound

This paper cites G., Sutton, R.

Enhancing Decision-Making of Large Language Models via Actor-Critic G., Sutton, R

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.151052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.251820Z digest=sha256:6c94d9c95383140df60858f76cb14025df7c3b6556de576873089ba398c03fa5

Observation 2168a1e0-8dd4-455f-9f7b-18017c98c202 · outbound

This paper cites L., and Singh, S.

Enhancing Decision-Making of Large Language Models via Actor-Critic L., and Singh, S

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.142798Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.255161Z digest=sha256:be8d43f37a9c9b13e3a3c4d389f705c4400216d6cb7ebbef04876078f588793f

Observation b7f2a298-d835-4bd1-af34-06a57bb0be0e · outbound

This paper cites The computational complexity of propositional strips planning.

Enhancing Decision-Making of Large Language Models via Actor-Critic The computational complexity of propositional strips planning

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.133991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.258099Z digest=sha256:055f87f1a1ed59bff95477ba4a8b2c3efa430f182313b8a4ecbfca3de91667b4

Observation dd9d9076-8045-41db-8410-883e6b4081fd · outbound

This paper cites Grounding large language models in interactive environments with online reinforcement learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic Grounding large language models in interactive environments with online reinforcement learning

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.124847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.261230Z digest=sha256:86e4de1b3d2375535e91fb8b70061f157935665d04657723b87210b0ab2181ea

Observation 59c50699-e384-45a9-acfe-58921f6706d3 · outbound

This paper cites Grounding large language models in interactive environments with online reinforcement learning, 2023 b.

Enhancing Decision-Making of Large Language Models via Actor-Critic Grounding large language models in interactive environments with online reinforcement learning, 2023 b

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.115918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.264183Z digest=sha256:940bfceadf194e780c409dc18763e4282493e664ca56aed7aa04a47df663e9ff

Observation 77a7d3de-3672-4db1-bbcd-0534a24b3157 · outbound

This paper cites Decision transformer: Reinforcement learning via sequence modeling.

Enhancing Decision-Making of Large Language Models via Actor-Critic Decision transformer: Reinforcement learning via sequence modeling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.267264Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.267264Z digest=sha256:940e9b30b47a9763532b563d8d9330719d33e4f955dfbeadfeb3c6475072e880

Observation ebaae906-8f3d-45cc-b8ea-90587c083b3a · outbound

This paper cites BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.269879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.269879Z digest=sha256:3c35f6c47ae8b316eee603358bdd2ca1d03c420a8092a7314ee7a8228a777f82

Observation ab4c0389-bc79-472f-bb80-913288a16547 · outbound

This paper cites Efficient selectivity and backup operators in monte-carlo tree search.

Enhancing Decision-Making of Large Language Models via Actor-Critic Efficient selectivity and backup operators in monte-carlo tree search

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.101508Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.272705Z digest=sha256:fba9712113eda88c96cfd9eb6b11748ef5a09929237485390adfd1ff8e0dabec

Observation 273a0c2d-3aa1-46e3-917f-7a4d294b61ee · outbound

This paper cites The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks.

Enhancing Decision-Making of Large Language Models via Actor-Critic The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.275248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.275248Z digest=sha256:f3f247952b8a14b2676da5ef0f1ee68fc3e2710286a89edb45b36bc8e1f42744

Observation e6b75a92-a039-4a5c-b076-ea2abdecd9b8 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.278393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.278393Z digest=sha256:510bdd1274ebf2e6cc03070da8898a97ef5a31070b048052d6b58ef385847c3a

Observation 4bd6fbee-d000-4806-ac94-da470ee7782e · outbound

This paper cites Task and motion planning with large language models for object rearrangement.

Enhancing Decision-Making of Large Language Models via Actor-Critic Task and motion planning with large language models for object rearrangement

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.092899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.281136Z digest=sha256:0f17800ec9d359933eb27f70370882ee1dab7ca4777a9a26155d2f92302038d3

Observation 06fd3275-af0c-40da-9583-c506bf321a1f · outbound

This paper cites Low-rank modular reinforcement learning via muscle synergy.

Enhancing Decision-Making of Large Language Models via Actor-Critic Low-rank modular reinforcement learning via muscle synergy

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.083971Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.283993Z digest=sha256:061aa91ab37becc70b1b957058ae80932a3da4bb347790d2352feae23db1bfd1

Observation fde0f198-05f3-43e7-8456-d66dcd5d460c · outbound

This paper cites PreAct: Prediction Enhances Agent's Planning Ability.

Enhancing Decision-Making of Large Language Models via Actor-Critic PreAct: Prediction Enhances Agent's Planning Ability

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-08-07T10:55:44.767850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.286512Z digest=sha256:14eb7681329c98ce049b904c8436de4f0fa10a81745b349f9ce4141a9e3d308e

Observation 62c6fff1-2d4d-4c47-96ec-20ee9e47d33c · outbound

This paper cites Addressing function approximation error in actor-critic methods.

Enhancing Decision-Making of Large Language Models via Actor-Critic Addressing function approximation error in actor-critic methods

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.289495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.289495Z digest=sha256:7ff4403d0e4a1e723c7a70a63dc9699253f03309b212b868b8714be7eaa4ced9

Observation edc425d8-0a9b-413f-aa1c-6f753ce0daea · outbound

This paper cites Aligning language models with preferences through f -divergence minimization.

Enhancing Decision-Making of Large Language Models via Actor-Critic Aligning language models with preferences through f -divergence minimization

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.069984Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.292179Z digest=sha256:c43be344e8766b7db72c5e3586848dd9c5c25c9907a38f65011942d266337234

Observation 2ac67d04-99fa-490c-9ed6-559499e0f2bc · outbound

This paper cites Benchmarking the spectrum of agent capabilities.

Enhancing Decision-Making of Large Language Models via Actor-Critic Benchmarking the spectrum of agent capabilities

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.061015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.294660Z digest=sha256:5b7b9c2df6e3ea6f99c23682d7808ad5f8e52ab441b62147f3a50239ad1b503d

Observation f79bef7e-05f9-42d3-b19d-2cb02e04ca24 · outbound

This paper cites Reasoning with language model is planning with world model.

Enhancing Decision-Making of Large Language Models via Actor-Critic Reasoning with language model is planning with world model

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.297209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.297209Z digest=sha256:cd35008409bc916ee4e76d44222b9b442e1017002759a08cad438d63592ebc4f

Observation 9e9defb4-19ea-4433-b16f-14bfa5b8bebc · outbound

This paper cites J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W.

Enhancing Decision-Making of Large Language Models via Actor-Critic J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.300066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.300066Z digest=sha256:7581f9f9070c395d643618a8dde4376b3a76ca3e723a75b12913a5b90518fb6f

Observation 83373baa-7c68-4e5b-8faf-e54c545eef5d · outbound

This paper cites Towards Reasoning in Large Language Models: A Survey.

Enhancing Decision-Making of Large Language Models via Actor-Critic Towards Reasoning in Large Language Models: A Survey

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.302536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.302536Z digest=sha256:4cef6be261549048a70e6e2fdc3fac2aa1a6438c470ab91c4a26218e12d25cd4

Observation 48bf0bc7-2a31-4f5f-9ece-ee18bb0f71ae · outbound

This paper cites One policy to control them all: Shared modular policies for agent-agnostic control.

Enhancing Decision-Making of Large Language Models via Actor-Critic One policy to control them all: Shared modular policies for agent-agnostic control

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.046114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.305625Z digest=sha256:23c62960d31bb1b77c031b4237e7ed648ea1051bcc70e7ea7e1f53e6d3c5fafd

Observation c654ec8b-8bc6-4ae6-b158-f6bab095a8d6 · outbound

This paper cites Language models as zero-shot planners: Extracting actionable knowledge for embodied agents.

Enhancing Decision-Making of Large Language Models via Actor-Critic Language models as zero-shot planners: Extracting actionable knowledge for embodied agents

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.037344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.308201Z digest=sha256:973c558125108b71fd54ef5cf288ae20b532bbaf3717bb1476020e018f902e4c

Observation 5b95ead7-6844-4ec6-9344-38c735df3674 · outbound

This paper cites Inner Monologue: Embodied Reasoning through Planning with Language Models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Inner Monologue: Embodied Reasoning through Planning with Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.310610Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.310610Z digest=sha256:53baab91033508db9bcbd5655e94c29e9892ddeeb427836d31a90f9714717f15

Observation f85e32c8-2672-4350-b218-7b57feb692c0 · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:45.028202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.313193Z digest=sha256:cd64b6c253e61e191fca81dd424668ecb522b0989ecf171e27b0be3c12186beb

Observation f5e38c5e-38e8-475c-a4eb-10f94397855f · outbound

This paper cites Learning trajectory preferences for manipulators via iterative improvement.

Enhancing Decision-Making of Large Language Models via Actor-Critic Learning trajectory preferences for manipulators via iterative improvement

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.019246Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.315854Z digest=sha256:9f05876a70cb6ddb5852db55e637f663c84a0b9990168ad31940bdf8cd717f17

Observation e3497c31-e362-41c9-85e0-4957d8befcd4 · outbound

This paper cites Mistral 7B.

Enhancing Decision-Making of Large Language Models via Actor-Critic Mistral 7B

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.318509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.318509Z digest=sha256:43a0f14ddc28804f6d84243918bfb52ae12aadfd84eadc7735cd76384b96623a

Observation 35d14291-865b-47b3-bc22-8e4d096f8785 · outbound

This paper cites A comprehensive survey on process-oriented automatic text summarization with exploration of llm-based methods.

Enhancing Decision-Making of Large Language Models via Actor-Critic A comprehensive survey on process-oriented automatic text summarization with exploration of llm-based methods

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.322888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.322888Z digest=sha256:4eee88679d8fcc1cb829760b947717353255dac25be0475bbf76b25826e6adb9

Observation ec19ea2e-4a17-4001-aefa-b0986b28b35a · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:45.010508Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.325521Z digest=sha256:65296b0241b8f7e690fb758f6d1ada6185e80810a21f1c0f82a5c0f855eadb5b

Observation e0343ef6-cb72-4f1d-ae60-525af75069d9 · outbound

This paper cites and Szepesv \'a ri, C.

Enhancing Decision-Making of Large Language Models via Actor-Critic and Szepesv \'a ri, C

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.328311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.328311Z digest=sha256:b3e0e192e7c48aac644bf07a2f5b6c70101459cce93f92d612b10a83f111db4c

Observation 7908c0e6-fd04-48d2-ad92-4408d6c67248 · outbound

This paper cites Y., McAleer, S., Fried, D., and Salakhutdinov, R.

Enhancing Decision-Making of Large Language Models via Actor-Critic Y., McAleer, S., Fried, D., and Salakhutdinov, R

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.331022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.331022Z digest=sha256:7da284f52a09ad7384f3ca12de0af62913580c98306d0cf4ba3a83d0f1d0a361

Observation a814a2f7-f3ec-4560-8c0a-c83797b52dba · outbound

This paper cites S., Reid, M., Matsuo, Y., and Iwasawa, Y.

Enhancing Decision-Making of Large Language Models via Actor-Critic S., Reid, M., Matsuo, Y., and Iwasawa, Y

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.333655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.333655Z digest=sha256:235222bbe3b2df6caf1190d2d614cee2d5b8164e7019ae10b148e94f49d01d9b

Observation 277a3b96-7b11-488d-a7dd-1ca7ca2b1ddf · outbound

This paper cites X., Nie, J.-Y., and Wen, J.-R.

Enhancing Decision-Making of Large Language Models via Actor-Critic X., Nie, J.-Y., and Wen, J.-R

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.336377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.336377Z digest=sha256:f32dc54e89c2c8c1fd207c2dcf6bce32af8aa3b00a200b0298830dd290227ce3

Observation 0e2da5ce-f74c-4a6f-a709-c5dff6fbc904 · outbound

This paper cites Unigen: A unified generative framework for retrieval and question answering with large language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unigen: A unified generative framework for retrieval and question answering with large language models

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.989911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.339233Z digest=sha256:c5fb158b5e3105f5a7462a3d0e991fdbf7523e47ee96dc38f709ffd78302da6b

Observation b7fbf1c0-8cf3-49f5-911c-b7e59b01d496 · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:44.980324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.341658Z digest=sha256:58c67c1f4fe1499f644af0ebc9078eca197276b5902efaa2b1f2c4018ac0a383

Observation 01e787f9-0c88-42d5-a948-b9bf48de9b7d · outbound

This paper cites Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency.

Enhancing Decision-Making of Large Language Models via Actor-Critic Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.457704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.457704Z digest=sha256:2ce73d11dc6fcb5e18b5f65e32200d3690d749cc5b240aa033e77de0571fa8f1

Observation 2f8d07c3-a60c-4d34-9168-bb15616861af · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:44.971943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.461051Z digest=sha256:0f7a71783a8ad8c15f6ba67f87a12318d9c051ac12646682a6a1ae4437797708

Observation 0ad159a1-a689-4cae-8e10-972e31afba8c · outbound

This paper cites Meta llama 3.

Enhancing Decision-Making of Large Language Models via Actor-Critic Meta llama 3

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.963613Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.463872Z digest=sha256:73f104af73515223714a6f47b4cea249a82d3ed32075cda02a045351c23e8081

Observation ed997408-8027-44f6-a260-2ff357ba1bc8 · outbound

This paper cites Meta llama 3.1.

Enhancing Decision-Making of Large Language Models via Actor-Critic Meta llama 3.1

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.954996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.466393Z digest=sha256:44a93b1a8da71e40836383920862d03b94e0360d9e7853b56b86c8a12eeb7a70

Observation bd9417d3-9dc8-451f-a888-91afc3a7b70b · outbound

This paper cites Augmented language models: a survey.

Enhancing Decision-Making of Large Language Models via Actor-Critic Augmented language models: a survey

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.946264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.469037Z digest=sha256:ab2ed275112d442579cf933fb391c28cc5416199486f0c54e03dac68702f369f

Observation 163cc2d4-c4e2-49bd-93c3-61050bed5f00 · outbound

This paper cites BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games.

Enhancing Decision-Making of Large Language Models via Actor-Critic BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.471737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.471737Z digest=sha256:4692e3102dffdee8d8e8a49cb1ff3539ae4b96a8d9ec9d4ec231c78f4fd6f2cd

Observation 4a91ba41-5412-4b3a-ba82-1d372584acd4 · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.474500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.474500Z digest=sha256:693d1f7c32b1ce0b0e4f02c4fe803efeccae4c6db5498154c31fe880d529668f

Observation 319de725-a390-4093-921c-24f013875939 · outbound

This paper cites and Schaal, S.

Enhancing Decision-Making of Large Language Models via Actor-Critic and Schaal, S

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.477102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.477102Z digest=sha256:fe0146fca5cfc5259a9e220c01005d05b601f1363a883537b9560235a22ac962

Observation c34eb28c-b6bf-4581-9945-4535d81cb2d0 · outbound

This paper cites Why think step by step? reasoning emerges from the locality of experience.

Enhancing Decision-Making of Large Language Models via Actor-Critic Why think step by step? reasoning emerges from the locality of experience

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.932022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.479697Z digest=sha256:8d3ae6339e3c8051b3631d0721a5a63a1b81ba454f289ed2d7f6ee5456cc80ac

Observation 01743166-a593-4771-a463-4a15f7212bfb · outbound

This paper cites D., Ermon, S., and Finn, C.

Enhancing Decision-Making of Large Language Models via Actor-Critic D., Ermon, S., and Finn, C

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.482320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.482320Z digest=sha256:e50307039a0ea5ecacd3babe5cb5ae93b80b953d3cc494d0eb629a3e90449fdc

Observation ea598e5b-acc9-4028-9028-af4d1cf71160 · outbound

This paper cites Code Llama: Open Foundation Models for Code.

Enhancing Decision-Making of Large Language Models via Actor-Critic Code Llama: Open Foundation Models for Code

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.484816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.484816Z digest=sha256:128f323782ff4e3bb45b3d1f1aa3ffa475a20e424c07479f490c74c29653d8e1

Observation 8e6f3dd8-db1b-4ce5-a1d0-25429639149e · outbound

This paper cites Proximal Policy Optimization Algorithms.

Enhancing Decision-Making of Large Language Models via Actor-Critic Proximal Policy Optimization Algorithms

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.487555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.487555Z digest=sha256:62b29a64ce1768638bafefc3598e699df97ea748866b8b082d2aa9b8a6bb56a8

Observation e4682510-9830-4f2a-a729-038bd34ddb05 · outbound

This paper cites Reflexion: Language agents with verbal reinforcement learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic Reflexion: Language agents with verbal reinforcement learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.490111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.490111Z digest=sha256:a941a1940ccd1a48c4693c4d52b5f180e363021b048dab4d5a0e1db23079dac5

Observation 11b55e9a-8dea-4083-838c-dd7cd39ad867 · outbound

This paper cites Alfred: A benchmark for interpreting grounded instructions for everyday tasks.

Enhancing Decision-Making of Large Language Models via Actor-Critic Alfred: A benchmark for interpreting grounded instructions for everyday tasks

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.912098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.492701Z digest=sha256:b7dec2bb7757ce5b52adbe6fcafd4f4b6ae1eb19f4e932f5e2b429293ce1d2ec

Observation e74a8459-b34b-490b-9a65-a0024ebd13d6 · outbound

This paper cites Alfworld: Aligning text and embodied environments for interactive learning, 2021.

Enhancing Decision-Making of Large Language Models via Actor-Critic Alfworld: Aligning text and embodied environments for interactive learning, 2021

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.903299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.495003Z digest=sha256:f0b0f475b6de05e3c25f3dac8e82147501bb2ba940886ac39ed171bb9b451fab

Observation 56c293c6-26b3-47ea-9086-c8aed55075a0 · outbound

This paper cites Progprompt: Generating situated robot task plans using large language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Progprompt: Generating situated robot task plans using large language models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.497377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.497377Z digest=sha256:ed7d8b84f505a5131d7fdb6d57c52024fe4b7bc678628e030994964a7079b35f

Observation 17417333-0912-4f74-9e50-becfb8978e61 · outbound

This paper cites D., and Toshev, A.

Enhancing Decision-Making of Large Language Models via Actor-Critic D., and Toshev, A

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.888314Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.500183Z digest=sha256:34fbc9f1582c09b2b208adedd12db3be2a2d30cc413e9fb2cabfcdf9d4c39817

Observation 61495bfc-42c5-491c-80ea-76d0aeb7f3f2 · outbound

This paper cites True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.879712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.502726Z digest=sha256:b3af836706babcecf10d19e41c8fef84e9ff320a0f0641bc6b2e26ac387a201a

Observation ac4d6994-e8ea-49eb-8f2b-cbe00d981b26 · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Enhancing Decision-Making of Large Language Models via Actor-Critic Gemma: Open Models Based on Gemini Research and Technology

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.505310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.505310Z digest=sha256:86f5014da7c5f076d7818ac33e8de6f9915e75cd20e512b9137ccde99ee93d8f

Observation b02096e9-2c90-4cbc-b0a8-ea3568ddbafb · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.508021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.508021Z digest=sha256:023103cee9440a91648cfa5b1d93ae4339ba3bbecda90116533aec7b6da6dad2

Observation d73eeb31-a55b-4e02-8247-df8e1f2f7128 · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:44.870756Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.510775Z digest=sha256:737b99a48638965b7a05f1f90191d6aed5041756c9a13e8400002c60e909d2c7

Observation c25f6ddd-dc09-48d4-9350-8e3d25bdb74e · outbound

This paper cites V., Zhou, D., et al.

Enhancing Decision-Making of Large Language Models via Actor-Critic V., Zhou, D., et al

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.513182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.513182Z digest=sha256:e559b90cb4bec32b5de6c93c61290726830cfef9f612e78d854e2c6ac07b5bc2

Observation c8d8e698-062d-48b7-88b1-95778729ebe5 · outbound

This paper cites Webshop: Towards scalable real-world web interaction with grounded language agents.

Enhancing Decision-Making of Large Language Models via Actor-Critic Webshop: Towards scalable real-world web interaction with grounded language agents

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.515658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.515658Z digest=sha256:b83d1a42ca0c2661c569e8f4469f2eb4d47e7901257da90a143c47d099183668

Observation 42b7e1e6-0945-4541-b622-0bf63df593cc · outbound

This paper cites React: Synergizing reasoning and acting in language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic React: Synergizing reasoning and acting in language models

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.518179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.518179Z digest=sha256:0c6b71909f10eaa14b90427ccae5366b3c28e8cc78f7677eb300705c7fe91d3f

Observation 64947bb9-e6d6-4e8f-923c-7162fe407f26 · outbound

This paper cites C., Liu, Z., Feng, Y., Xue, L., Rithesh, R., Chen, Z., Zhang, J., Arpit, D., et al.

Enhancing Decision-Making of Large Language Models via Actor-Critic C., Liu, Z., Feng, Y., Xue, L., Rithesh, R., Chen, Z., Zhang, J., Arpit, D., et al

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.844499Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.520944Z digest=sha256:85ec55d8d6c129ed75145e9c7094d858d7960c8bc3c77a4ed54ce4d443ab5165

Observation 472a3cc8-de4a-4b05-8766-b80fb2efa25a · outbound

This paper cites Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach.

Enhancing Decision-Making of Large Language Models via Actor-Critic Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach

Reference 60

Resolution
verified exact
local_arxiv, observed 2026-08-07T10:55:44.581052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.523696Z digest=sha256:dd18070575e20c8e2c851ce3a916e82f1f11c6610c5351f35f4c70eb51d8f281

Observation b77abfaa-bc0b-4880-bf6b-be5f5fbb1df1 · outbound

This paper cites Large language models are semi-parametric reinforcement learning agents.

Enhancing Decision-Making of Large Language Models via Actor-Critic Large language models are semi-parametric reinforcement learning agents

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.835461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.526453Z digest=sha256:d4776be8b4858791277bd3361323373abf6b0b70b746cb75216a00115c0d67c7

Observation b27d00e7-f66f-454a-b8f4-507347a539f5 · outbound

This paper cites Language agent tree search unifies reasoning, acting, and planning in language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Language agent tree search unifies reasoning, acting, and planning in language models

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.827040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.529045Z digest=sha256:fdc510f8adb698192657dfac3573932251731c7059131a78e01dd48fe737146a

Observation 1d16ed95-0271-4c05-b3a7-166c87a4cd8f · outbound

This paper cites Archer: Training language model agents via hierarchical multi-turn rl.

Enhancing Decision-Making of Large Language Models via Actor-Critic Archer: Training language model agents via hierarchical multi-turn rl

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.818408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.531578Z digest=sha256:e18987a2a59c8f0dc6b9aa4e78543b6793601cbb755fe5309429e9af132b5b15

Observation f1c2c3a5-e6c6-4360-8658-418e81908b5b · outbound

This paper cites write newline.

Enhancing Decision-Making of Large Language Models via Actor-Critic write newline

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.534042Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.534042Z digest=sha256:842779b423ed6670467ecb20870a4edd9029bc500ece9aa27024b38eb65f56eb

Pith citing papers

No inbound Pith citation observations are available.