Pith. sign in

Paper Citation Record · LEDGER

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

As of 22 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 5 inbound Pith citation observations for arXiv:2505.19761.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19761 v1

Coverage vector

measured 64 of 64 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:10:10.212302Z

measured 69 of 69 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T22:15:13.878078Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T19:36:09.116821Z

Reference resolution

64 of 64 outbound references displayed

  • verified exact0
  • verified fuzzy46
  • unresolved18
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9d07db5a-7295-42cb-bea6-e8b0e9b31242 · outbound

This paper cites Do as I can, not as I say: Grounding language in robotic affordances.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Do as I can, not as I say: Grounding language in robotic affordances

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:18.210682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.230679Z digest=sha256:696f175ac362f90e4ccdb27ce291392d04197b5bce90ccfda5c60ccc57adde33

Observation a722c448-b34b-4697-9588-f06d6c6dd6c1 · outbound

This paper cites The option-critic architecture.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning The option-critic architecture

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:18.027624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.282851Z digest=sha256:e5c8a463f943be0f4ccb074fdf6783483ba053c7bed33c73bb7c03c42589b71d

Observation d2be6b60-0de8-46f4-9a21-1aef512d2deb · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:02.397659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:02.397659Z digest=sha256:d036f1741f2b5024f0e2b1341e3f74934c6fe358e2dd169b5ceaa7994dde81e9

Observation 289307af-8d95-485a-974e-6b20dfc44ac0 · outbound

This paper cites D., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning D., et al

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.898002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.543956Z digest=sha256:17947b2e13d2c5342fc9f316f5292067307a8ec2206de033e09e755bc5524e98

Observation 796fa1f8-143f-4981-b713-bcf9fcb9e3c4 · outbound

This paper cites Exploration by random network distillation.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Exploration by random network distillation

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.745625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.640172Z digest=sha256:babb0d22ca7065a9013c3cc8ad4a71794dc111427ad8418dc61bf90d7c3b55c3

Observation 4e07b629-aa8e-4ecc-a5f4-db57fc4ab08d · outbound

This paper cites FireAct: Toward Language Agent Fine-tuning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning FireAct: Toward Language Agent Fine-tuning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:02.785697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:02.785697Z digest=sha256:d999590ae9fcdeab2b75b490dce1134f5d81dc72f26c1fa26ab70c72ca48cf03

Observation 9b6de2aa-24f4-4e91-a5d9-3fefab329281 · outbound

This paper cites AgentVerse : Facilitating multi-agent collaboration and exploring emergent behaviors.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning AgentVerse : Facilitating multi-agent collaboration and exploring emergent behaviors

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.537430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.963368Z digest=sha256:b402627b697cca02d02aea551afbd34df7c55300c516b260fbcf4781ab984136

Observation d32de7ba-44ca-4ab5-b97d-ec22890804e2 · outbound

This paper cites an unresolved cited work.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:10:17.393769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:03.087942Z digest=sha256:0825ccd10cd899ca9556bacaffa69c5ea3662adbaa4a2fe165e4eed7307b3a18

Observation e4be9148-0eb1-43e9-9027-29071750a07c · outbound

This paper cites M., Hao, B., and Van Roy, B.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning M., Hao, B., and Van Roy, B

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.254719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:03.277623Z digest=sha256:fa37ef78256692d63a453dd308e946b5d29e629f219652341c8e87bf4925ab16

Observation db524625-8384-4c06-a8fb-106df05b7656 · outbound

This paper cites Off-policy deep reinforcement learning without exploration.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Off-policy deep reinforcement learning without exploration

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.427429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.427429Z digest=sha256:f437b3e85d3be51092d16df2f8cf74ca127534ca67661ac5730e981933ee7e7c

Observation 7bbc3abe-c7af-42c5-8d23-92ae46e2969b · outbound

This paper cites Strategic Reasoning with Language Models.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Strategic Reasoning with Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.550763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.550763Z digest=sha256:cae0c67a76e1fe02bcc947bf9393736a7cbebe0d460509bf0b844649c1e60bd5

Observation 6328885d-5939-4bae-8b6e-560f21a47f00 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.622363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.622363Z digest=sha256:f40d88d1d82b3604117627cb54f6cb64ff99adce892b911547d2d9f481f33841

Observation 8fd853a4-a4a7-4bf4-a975-3bd33e9d9a63 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.721409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.721409Z digest=sha256:206c635ef627dc8347c7ea41a8c977630b80d23492a9049e8b892f743a27d377

Observation 0b40f5b6-f192-4a5e-bde9-97e46e2562ac · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.111830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:03.885536Z digest=sha256:a639949ce0ed31f1cb3d5cd837f8f69b3d49923a9f9c3b821a05f548d09895d8

Observation 819c0c3a-020b-45fb-b08b-477d2d69551a · outbound

This paper cites J., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning J., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., et al

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.965165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.056340Z digest=sha256:b1f51ec4a31d3c156d3b8b579825e074f9caa6a63bc6bdf2d77a867388a45084

Observation 613b845b-1b4d-4796-bece-74af77b6b1e3 · outbound

This paper cites Mistral 7B.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Mistral 7B

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:04.210323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:04.210323Z digest=sha256:6f77ba241227bb4ab65fd435f4925a6ede306d8cb46024b1d69b4036ff229d56

Observation f18cde6b-72fc-4d04-965b-ffc3fc988e3b · outbound

This paper cites and Tsitsiklis, J.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning and Tsitsiklis, J

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.813391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.312190Z digest=sha256:fd0e5847b4dd02c6a813accbabad7828a89b42915c8d6f8cbfe117e0104a8745

Observation 0b34ae5e-466c-4a74-8511-892be0c26f13 · outbound

This paper cites Offline reinforcement learning with fisher divergence critic regularization.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline reinforcement learning with fisher divergence critic regularization

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.674617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.475258Z digest=sha256:d140ccdce7d986d391a430621fd84a4ab5e85ae6f82feb7d48f541b03e8bc840

Observation 319fa590-4745-4bd9-a996-5baecd7a2daf · outbound

This paper cites Offline reinforcement learning with implicit Q -learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline reinforcement learning with implicit Q -learning

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.498767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.665987Z digest=sha256:274019f9c06324383bbff8a00e3800f192c35a60d4ad7f3a514759905a307f00

Observation a908e7ec-780d-4ac8-aeef-94c2b913ce61 · outbound

This paper cites Conservative q-learning for offline reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Conservative q-learning for offline reinforcement learning

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.363398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.759415Z digest=sha256:20405de8e2c484c3d79b010e9888a93e2109256d2bd7f0a384cc64eefcb3c197

Observation 78a1cb6c-17e3-4867-bdc6-02a0c6111f80 · outbound

This paper cites Offline-to-online reinforcement learning via balanced replay and pessimistic Q -ensemble.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline-to-online reinforcement learning via balanced replay and pessimistic Q -ensemble

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.216740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.863409Z digest=sha256:7b9401956100dcd96c96e9dadc9577ab9c4adaf9ddb2313c81d467cacf59b868

Observation 9058df54-5295-4725-90ea-4206a20bccf9 · outbound

This paper cites Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:05.005459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:05.005459Z digest=sha256:c9523f52483171a5bee2d92122d53a2907e7897e554c2887e728d9852284a6a6

Observation 7b5689fc-12fe-4cb2-a50c-3a77ace1c66f · outbound

This paper cites Learning multi-level hierarchies with hindsight.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Learning multi-level hierarchies with hindsight

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.096283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.168375Z digest=sha256:b08226804256c8d1e4e4ba4751f2933c6eb751a07da37ebbd77e37545c3bb732

Observation 487df6e2-9e17-43f1-a4e9-1eb6f6c52caf · outbound

This paper cites Sub-policy adaptation for hierarchical reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Sub-policy adaptation for hierarchical reinforcement learning

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.944303Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.305271Z digest=sha256:dbedfcc942cd3e22c515858cf9dc3b71c96791de8d52300eec8372312903788f

Observation d53069d9-d50c-46d0-9dcc-8da3b2ef9c00 · outbound

This paper cites Pre-trained language models for interactive decision-making.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Pre-trained language models for interactive decision-making

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.826814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.449975Z digest=sha256:90618fe0800ce0ff4140804b23e9a6b364aeef4a6c2d0541cbea2a5ae4742c0d

Observation 3ff69c08-a549-4fb5-b8aa-830304fb34d3 · outbound

This paper cites Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.716059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.555089Z digest=sha256:1fb605165558afdf460182426da1da184d22dded25978a6eb2897a9f94c18bef

Observation 57fd0717-282a-4b0a-ae9a-27b6bedfb48d · outbound

This paper cites Y., Fu, Y., Yang, K., Brahman, F., Huang, S., Bhagavatula, C., Ammanabrolu, P., Choi, Y., and Ren, X.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Y., Fu, Y., Yang, K., Brahman, F., Huang, S., Bhagavatula, C., Ammanabrolu, P., Choi, Y., and Ren, X

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.603802Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.728248Z digest=sha256:f3db93abfb47546b458828d267acfd30c47a5345d26ade1b05e15bffb7649366

Observation ae985a6f-8e1c-4c2b-ab7d-149aa6803a82 · outbound

This paper cites WizardCoder : Empowering code large language models with evol-instruct.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning WizardCoder : Empowering code large language models with evol-instruct

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.488970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.837398Z digest=sha256:28b3e8be930a1382cf8cb33654679e8aa8777d27e916f4cf73004533836de2ae

Observation 7ccabb6a-d1e4-4962-a23a-1c4c0de5c182 · outbound

This paper cites Large language models play StarCraft II : Benchmarks and a chain of summarization approach.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Large language models play StarCraft II : Benchmarks and a chain of summarization approach

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.364202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.007368Z digest=sha256:44ec3e553d1fc74bafde66349d1b037443bad502ff225b6f03ecba65611f6353

Observation fcb8a6c0-db08-4d4e-874d-382e06b90512 · outbound

This paper cites Random latent exploration for deep reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Random latent exploration for deep reinforcement learning

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.232748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.132846Z digest=sha256:133f2c8d4eed269853dabeac604d005c90bcbfa35d2857f9f5015d1e9e39bb18

Observation f9aae58d-80e1-4cee-a254-a3518ae47105 · outbound

This paper cites Introducing Meta Llama 3 : The most capable openly available LLM to date, 2024.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Introducing Meta Llama 3 : The most capable openly available LLM to date, 2024

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.123541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.317145Z digest=sha256:9ba626c81e82a2002001f54b5ea4a8bc6de42c68cd518206c2c98c19a2d33db9

Observation 29f99d6a-2af5-42a3-a2f9-da319bea9f49 · outbound

This paper cites S., Lee, H., and Levine, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning S., Lee, H., and Levine, S

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.960814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.796178Z digest=sha256:fbacfe229dec8251cfaced1251d990b170d9561587a3535c3565b048d3bdadfa

Observation bc381cf7-0efb-4f86-95dc-7ecc932b2e4f · outbound

This paper cites AWAC: Accelerating Online Reinforcement Learning with Offline Datasets.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning AWAC: Accelerating Online Reinforcement Learning with Offline Datasets

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:06.985557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:06.985557Z digest=sha256:f9d258db1853d14dd6dd2060d591a95a59d378da714709d3849cb7ca787fc12d

Observation 3ace0f39-234c-43ff-af15-f5797e3e83f5 · outbound

This paper cites Training language models to follow instructions with human feedback.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Training language models to follow instructions with human feedback

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.854618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.094830Z digest=sha256:2a4c5f7d8345e97fe9e6836e7d2d2df3619714ea0d1a69614bd9b3166c55b95f

Observation b1de15fc-17b2-4ff3-a9bd-8c415313b8ef · outbound

This paper cites Agent planning with world knowledge model.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Agent planning with world knowledge model

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.736055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.215775Z digest=sha256:c1e1aec46d7acbd964bd70fa3ec21ec9a66452c93c4d8fa2be26e1fed98bc4f8

Observation 4776b385-8e62-47de-be6c-8e28b200137b · outbound

This paper cites D., Ermon, S., and Finn, C.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning D., Ermon, S., and Finn, C

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.591349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.330924Z digest=sha256:b8fad08e2dc5f231f7356a790929cda5f5414a763938ebb4fa2f9dc7882a022f

Observation 3952f539-f130-45db-85cc-da379d8d9b3e · outbound

This paper cites Vision-language models are zero-shot reward models for reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Vision-language models are zero-shot reward models for reinforcement learning

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.400181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.431665Z digest=sha256:c7705319aa2ba2b4981d3dc247a3f7bd07b4031d904b1f60e87bf6ee47be6627

Observation 2cc8757b-1210-4607-8608-cc1de01707c5 · outbound

This paper cites LM-Nav : Robotic navigation with large pre-trained models of language, vision, and action.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning LM-Nav : Robotic navigation with large pre-trained models of language, vision, and action

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.259603Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.530842Z digest=sha256:bbf65345a7bf4bcdf5b0a247f6007bafbc7251f06579378e32903d2c751e98b0

Observation 89449e9f-520f-42e1-858c-fdd1e180e67a · outbound

This paper cites R., and Yao, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning R., and Yao, S

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.122648Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.675518Z digest=sha256:31a40109aa2ad8cfc5b5a1af10fc13bbb0d7479e88394bad1a422cb69024b7a4

Observation 4018fc4c-3c74-48ab-b043-127f74412a6d · outbound

This paper cites ALFWorld : Aligning text and embodied environments for interactive learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ALFWorld : Aligning text and embodied environments for interactive learning

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.960667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.794874Z digest=sha256:103a8cceb84a809645d42d778d2da94b92ccffe2380ae0a6f0a56b8588d5b97e

Observation 990d2e2e-6975-4aca-bd16-f1b701435349 · outbound

This paper cites J., Guez, A., Sifre, L., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning J., Guez, A., Sifre, L., et al

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.801005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.929050Z digest=sha256:236ed0143c30cb38746a43c2c51617acbfa30dfa4254b20bfb889f690eb9170e

Observation 7516a701-86be-4265-a00b-2e4f71025de2 · outbound

This paper cites an unresolved cited work.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Unresolved cited work

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:08.012224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:08.012224Z digest=sha256:253b19287fd0631e5f853a270a434c673ec4ed382d6c8a964e5489fd0a00e1d9

Observation 1c81e55a-07b8-4f71-aee3-d8adf7f4f5ff · outbound

This paper cites V., Kostrikov, I., Su, Y., Yang, S., and Levine, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning V., Kostrikov, I., Su, Y., Yang, S., and Levine, S

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.638662Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.132385Z digest=sha256:a634f06731e776c8b88c1f72518f20ecf5be560f466f23f18d29953dd9074059

Observation e495eefc-6550-4c38-92f0-d13fa9830d83 · outbound

This paper cites an unresolved cited work.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:10:13.501201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.280213Z digest=sha256:00c520392cebf153ecfbeee39889f1ed3c593b83790551cd852038d6c35563f7

Observation cf82ee6d-9e04-4a2e-a65f-775399f8cedb · outbound

This paper cites S., Precup, D., and Singh, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning S., Precup, D., and Singh, S

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.364536Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.367120Z digest=sha256:eb6e29c4964ab4a8a4820548e722eb373c22184328a22fdbb89dfce8262c9021

Observation d5382900-7b59-461f-b1dd-80846282a29d · outbound

This paper cites D., and Toshev, A.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning D., and Toshev, A

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.159958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.442559Z digest=sha256:634e306a5aedeb7e897be7f0d060c51483c8a4658f4c0d74fb905e15c74aaabd

Observation 0101f403-ec39-4b99-84e6-c1ecfc1f4cf3 · outbound

This paper cites True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.992598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.544889Z digest=sha256:e7e2ffe1c274838d1fe972fc5bf4b1df0b44da8f00a4d8a6ca76ee295e4db5d1

Observation 33c33ad7-14a3-4e3f-86f5-90945701cb48 · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Gemma: Open Models Based on Gemini Research and Technology

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:08.636760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:08.636760Z digest=sha256:a6f5cafa1c370a6dbb3c279bd4f03319ae5a8c942e62630180736ecc1edc6c48

Observation 1723885e-f9f5-4c7b-b879-4d449a030dbe · outbound

This paper cites K.-W., and Lim, E.-P.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning K.-W., and Lim, E.-P

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.701162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.712539Z digest=sha256:03d407aa7c0458e78f3779c0e9c7d986de34b06a3e7363182107587496c4863a

Observation 86cd567c-16ef-4247-afda-fe2b444cd59a · outbound

This paper cites ScienceWorld : Is your agent smarter than a 5th grader? In Proceedings of Empirical Methods in Natural Language Processing, pp.\ 11279--11298, 2022.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ScienceWorld : Is your agent smarter than a 5th grader? In Proceedings of Empirical Methods in Natural Language Processing, pp.\ 11279--11298, 2022

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.560024Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.839365Z digest=sha256:80dc853c8d9d9dfeabeedcbd6169bd6891e952db55fd5eb95ac2197eaf731e04

Observation 748cf0a8-fb8c-4516-882a-c84645db6add · outbound

This paper cites Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:08.942221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:08.942221Z digest=sha256:9a98fdaffc40677b4f3680607983c48bc37ec4a6aa75c91970b1bd6ad4456dcf

Observation 9255f265-83f0-42d8-93a7-edec033e530a · outbound

This paper cites Train once, get a family: State-adaptive balances for offline-to-online reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Train once, get a family: State-adaptive balances for offline-to-online reinforcement learning

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.404091Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.095344Z digest=sha256:63c4bf7fe62401f5688f1af2d71c7d16a77f7438a5b82738d0afb95b6bf4b39a

Observation 07a6e097-2acc-417a-9928-e0d07247b6bb · outbound

This paper cites V., Zhou, D., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning V., Zhou, D., et al

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:09.201429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:09.201429Z digest=sha256:8b6ee452e9a5b185b709eea0f902ab070e27ebe025d90028f5b2c3b7411a84af

Observation ddd918c2-3de6-4f56-9bc8-1f16419d28cd · outbound

This paper cites and Jennings, N.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning and Jennings, N

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.269917Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.321787Z digest=sha256:ac11f2b23a79be2012c5585edb62765c93fc44a205947f09330ff16904fa2518

Observation 2c1f8ae7-6869-4559-94c5-4013f2ab54dd · outbound

This paper cites The Rise and Potential of Large Language Model Based Agents: A Survey.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning The Rise and Potential of Large Language Model Based Agents: A Survey

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:09.384612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:09.384612Z digest=sha256:e63ee5e342c37b2650a1d86a86e99f78b1863d948c0287521b6ade5361f944e4

Observation c70ee563-a50c-4e93-979c-51288df6d0a9 · outbound

This paper cites Language agents with reinforcement learning for strategic play in the werewolf game.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Language agents with reinforcement learning for strategic play in the werewolf game

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.042081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.494820Z digest=sha256:d5743d5433224e031b2d2af674accab88bbf2c86d9e06f12b7852764711db2cc

Observation 0185b1c2-0b29-414c-b1c1-c5794eee1498 · outbound

This paper cites L., Cao, Y., and Narasimhan, K.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning L., Cao, Y., and Narasimhan, K

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.794886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.589788Z digest=sha256:c54854bb14b8ede1b619a3a3faa7f2ca44bdb232f11d78d073381c76591352b5

Observation 817ec64a-3d18-48ab-9631-d848d3332896 · outbound

This paper cites ReAct : Synergizing reasoning and acting in language models.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ReAct : Synergizing reasoning and acting in language models

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.610093Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.673939Z digest=sha256:eb4c943c5ef5c31a0a03d677f1c4fb5efdf4191e51b767efafc7f7a7093c4b88

Observation fc3a4105-8d4c-4a4e-a273-14bf42a0acd4 · outbound

This paper cites and Zhang, X.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning and Zhang, X

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.419903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.777609Z digest=sha256:feefc073b6dba6ce62069a747487d40ef1494c6510bcac2cf9d5e0541bf09716

Observation 48c2b5e5-ade5-4ae1-8b20-498d33b23bb1 · outbound

This paper cites AgentTuning: Enabling Generalized Agent Abilities for LLMs.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning AgentTuning: Enabling Generalized Agent Abilities for LLMs

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:09.861270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:09.861270Z digest=sha256:50a768c11ab6d4ab94f524d88c014212fa08feb8c9892a6286c0bca0e27c476d

Observation 6a976452-1826-4171-81c3-eabbf5704b52 · outbound

This paper cites Fine-tuning large vision-language models as decision-making agents via reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Fine-tuning large vision-language models as decision-making agents via reinforcement learning

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.152936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.941309Z digest=sha256:d65826b20d4c3a47bca9981050b83e66f69ab9d82e4b183a8787bc70c4b180ed

Observation fd947cf8-8c63-4b6d-ad67-9eac04d6b612 · outbound

This paper cites V., and Chi, E.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning V., and Chi, E

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:10.882812Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:10.079649Z digest=sha256:3de4b6a45d07b511e94d6685cdf6cda888cc8f67c672ce39269ff1f015929aaa

Observation f01e7953-3233-4980-930d-fd6b86528269 · outbound

This paper cites ArCHer : Training language model agents via hierarchical multi-turn rl.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ArCHer : Training language model agents via hierarchical multi-turn rl

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:10.645452Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-07T14:10:10.148144Z digest=sha256:7b38593d96bf98d5fd27f63f91695fa3e920a7014c43d206d808627336e0a6bd

Observation 957e7a45-d9e3-4f42-9ef8-5939a58610e6 · outbound

This paper cites write newline.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning write newline

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:10.212302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:10.212302Z digest=sha256:b8a97234bcb840516a0f390cd9925f617b5eb560b0545e4a4bc0e21e8a43cdb9

Pith citing papers

Observation 78f0ead6-0e63-42c4-9531-88f652aca04e · inbound

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory cites this paper.

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 226

Resolution
metadata mismatch
arxiv_id, observed 2026-05-14T23:13:15.620491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-14T23:13:15.016486Z digest=sha256:7a23c660b426f07398e4ee3d24ebf6f05cf6e08f15742755aff25527ce44fac4

Observation 9085988c-cfee-4f5c-9c20-28609aaea7a6 · inbound

Agentic Reasoning for Large Language Models cites this paper.

Agentic Reasoning for Large Language Models Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 131

Resolution
verified exact
arxiv_id, observed 2026-05-17T15:14:26.096893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-17T15:14:25.558878Z digest=sha256:7dbde7ef80225be657cde4c2b47c139cda62224f8ebfdeef5dc40ab21a532997

Observation 3ee393cc-93e7-424b-a369-c7cbf8af333f · inbound

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents cites this paper.

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T18:36:28.440409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-15T18:35:45.900606Z digest=sha256:fb4ffadd51305af517a1df286c04599f24720a171b33eab3e479726e6167bf53

Observation 68d5c6ab-a654-4ac0-becd-bec365c45249 · inbound

Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading cites this paper.

Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-11T16:26:05.986088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-09T17:08:46.405278Z digest=sha256:61df7a5099b588a327db2a8882c4ceabf57a13d000c73ede7137076a5eaf1669

Observation 14b9cd96-96f3-4b2a-864d-29f7400d0a09 · inbound

DeSQ: Decomposition-based SPARQL Query Generation cites this paper.

DeSQ: Decomposition-based SPARQL Query Generation Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 57

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T19:36:09.118286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-06-28T22:15:13.878078Z digest=sha256:186c4d215e577bf41e37056f101cbc3f1dde47c8f2e001df2bd535c2e1527eb6