Pith. sign in

Paper Citation Record · LEDGER

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation

As of 18 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.11221.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.11221 v1

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:59:41.281514Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

50 of 50 outbound references displayed

  • verified exact0
  • verified fuzzy26
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 12b45feb-cf55-4525-be8a-32e6644f08ae · outbound

This paper cites Mastering the game of go with deep neural networks and tree search,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Mastering the game of go with deep neural networks and tree search,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.016760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.016760Z digest=sha256:7d9eb970d7d6459d98c915f89d9fd9f832bd52cbbf923eaa91a63d46846458f1

Observation 374f6784-dfc4-457b-873e-63da11c83dc0 · outbound

This paper cites Advanced planning for autonomous vehicles using reinforcement learning and deep inverse reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Advanced planning for autonomous vehicles using reinforcement learning and deep inverse reinforcement learning,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.197622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.022428Z digest=sha256:725c05d09e75d8ce88534d9899b000150c589c6c6976097e32ee97cfa7a36985

Observation 2ada002b-50ab-4b48-999c-61eff2ab90db · outbound

This paper cites Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipu- lation,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipu- lation,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.180669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.027555Z digest=sha256:a541a39514cdee6d5753db3181bf51e7134f98c17741feedd97ec1d06d830760

Observation 88899db3-57af-4c87-973e-c91341cb9213 · outbound

This paper cites Mastering atari, go, chess and shogi by planning with a learned model,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Mastering atari, go, chess and shogi by planning with a learned model,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.161273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.033210Z digest=sha256:0a27649cfabf9e685f23fcc452923c519d0ff13c11c98f38b62ccb66484f0d8a

Observation e761d655-2eb4-46a3-b0a8-a6924722d97d · outbound

This paper cites Hindsight goal ranking on replay buffer for sparse reward environment,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Hindsight goal ranking on replay buffer for sparse reward environment,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.138548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.038495Z digest=sha256:fc06df7a3bae314cc220fb05c746849cff97b0aa77242f9a489c87bb10b9e379

Observation cacf23d0-8b6d-43f3-afdb-3bcaa311684c · outbound

This paper cites Utilizing skipped frames in action repeats for improving sample efficiency in reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Utilizing skipped frames in action repeats for improving sample efficiency in reinforcement learning,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.116098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.044058Z digest=sha256:b516c31412b2dd363526e8d8b3fcea37705df5a449a91fec75e6b8bc4e2e920b

Observation 23b1ea9c-e676-46a9-9cc5-63fada2bb3e8 · outbound

This paper cites Predictive coding for decision transformer,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Predictive coding for decision transformer,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.096012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.050425Z digest=sha256:d3f44cbe24dd8efa41f4548f2b9aefca1f66334a28d554dbca214c582f3273b9

Observation 6a11b1b3-ac27-41a0-9bfa-2f64ad4911f9 · outbound

This paper cites Dota 2 with Large Scale Deep Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Dota 2 with Large Scale Deep Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.056303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.056303Z digest=sha256:6146749d84064c638673bfef59c7ac1814812aa7e9e2214d22894962ded475ab

Observation e12c152e-d9b1-43e1-abd5-c26168028409 · outbound

This paper cites A comprehensive survey on safe reinforce- ment learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation A comprehensive survey on safe reinforce- ment learning,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.078854Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.061637Z digest=sha256:ad655845f9a27f1f3238b6968c199dc1e7a434c733ee7b92f5a1ad661d7b999d

Observation 21454ae8-9264-4d55-b328-08ade17e5816 · outbound

This paper cites No falls, no resets: Reliable humanoid behavior in the darpa robotics challenge,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation No falls, no resets: Reliable humanoid behavior in the darpa robotics challenge,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.060001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.067101Z digest=sha256:d758c88603b95e8ba88fe4c1b8e331ae383c3e835db1b16bff35a735fe6be8ed

Observation 2819d1b1-c94e-4d10-aebe-a8f57790659b · outbound

This paper cites Deep reinforcement learning: A brief survey,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Deep reinforcement learning: A brief survey,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.040985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.071821Z digest=sha256:e03fda377fa6da3314cc7fbc7c668e11bc5374cf769c880c4196babf6ce2b86d

Observation 004f6a71-28d9-429f-8bff-8b3771b7e502 · outbound

This paper cites Language models are unsupervised multitask learners,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Language models are unsupervised multitask learners,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.076975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.076975Z digest=sha256:a8ac33d10009a5ef55ed93748a7c490cf189cd598f20efafa70ac56e1622c039

Observation 1a12b399-4e20-4909-9477-33ca8df11950 · outbound

This paper cites Language Models are Few-Shot Learners.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Language Models are Few-Shot Learners

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.082178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.082178Z digest=sha256:c26cf854689609f6730e36cea6db47c0cd15c99341fc5bd704d1bc1104bb41ab

Observation 3b9b039e-4a3d-4c01-98fe-c08c0e227e66 · outbound

This paper cites On the Opportunities and Risks of Foundation Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation On the Opportunities and Risks of Foundation Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.087154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.087154Z digest=sha256:4aaf7aaf8d342e9d7b920ae36b2642e4828a4b4454b2a72ffff2450bdee24a7c

Observation 309e9cdc-7ec7-45f7-8d12-f298c6c72fd6 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.091688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.091688Z digest=sha256:5ac152b4e4fb70eb38eff404de8e60961f00056f18abeedfc31f4ccfd7830cd7

Observation e853ad67-0be1-4149-8690-34eeb5e2efdc · outbound

This paper cites Openai. gpt-4v,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Openai. gpt-4v,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.009167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.097123Z digest=sha256:cfa54b47b0f21c7dd3f86f2686d310ee85b106da36efaf69304923d8262bf35c

Observation 73121656-f8a6-48f4-94f6-cee085346f26 · outbound

This paper cites Do As I Can, Not As I Say: Grounding Language in Robotic Affordances.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Do As I Can, Not As I Say: Grounding Language in Robotic Affordances

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.101775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.101775Z digest=sha256:988e49e8f04259af5b8a91a48a8801c4fdf6657e350b232b643b830d9952bb29

Observation 0887c92a-18f5-4763-9aa5-0fb8b905530d · outbound

This paper cites Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.989419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.106538Z digest=sha256:f33b9f66f451b960f6ac736e906743c703431aa20705c7faf29283da8a67fc5d

Observation fcbea04e-e131-4401-9fec-3787d0fbcbee · outbound

This paper cites Large language models as generalizable policies for embodied tasks,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Large language models as generalizable policies for embodied tasks,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.972020Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.111452Z digest=sha256:9390cbe13cd2727c52858b62e9131a17117149f3424779dad7de6d8123b22161

Observation e1b7d85e-be24-4f27-acb9-2c7dc0e7d20f · outbound

This paper cites Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.116130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.116130Z digest=sha256:33ccfb4ca72ec8d25ad468a425777c5646b104c12b1e581d48d6e53e515245a1

Observation 399ad55a-72b2-4784-9348-0ab362b99e56 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation LLaMA: Open and Efficient Foundation Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.122020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.122020Z digest=sha256:399574592ff60aefb59d40d16596acb5328498be24ff6058ea5b32eee1639e44

Observation 72b92636-9d51-4181-8bd3-1892a3bd2cb7 · outbound

This paper cites Palm: Scaling language modeling with pathways,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Palm: Scaling language modeling with pathways,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.954129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.126397Z digest=sha256:b10e8d105c2363131bde4fd6850c11d1c94b411051d616e5391562fa21b064b2

Observation 98407cff-95d8-42a0-8cb6-470690c23c8a · outbound

This paper cites Distilling the Knowledge in a Neural Network.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Distilling the Knowledge in a Neural Network

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.131638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.131638Z digest=sha256:c1c955fd60d9d24d9ae808dc4a6a7bd47a5aac680cfe1defdb3c847cdb0e20d3

Observation 304c07cf-6812-4672-98ba-78a28767842e · outbound

This paper cites Proximal Policy Optimization Algorithms.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Proximal Policy Optimization Algorithms

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.136847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.136847Z digest=sha256:9c4d6192bc0207607389b132121686c0511f0ce0f0b92c4af76c1cf40185035c

Observation 9375b1ad-ebf4-4abd-8857-850b3cbece2d · outbound

This paper cites Asynchronous methods for deep reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Asynchronous methods for deep reinforcement learning,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.936201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.141241Z digest=sha256:e175d6873d22ef41196a0387f56ad51907aa39c1c6c19cb6f51e3a2362649f51

Observation 7ae865fb-960e-4774-9e16-aa28089e8908 · outbound

This paper cites Guiding pretraining in reinforcement learning with large language models,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Guiding pretraining in reinforcement learning with large language models,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.919926Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.147213Z digest=sha256:77805d770e395546f3de1abf9ad7c4b5f3cfb4461c5ccfb335651b8c92a1b066

Observation cb90abaf-fed4-450d-a731-507c58d1852f · outbound

This paper cites Progprompt: Generating situated robot task plans using large language models,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Progprompt: Generating situated robot task plans using large language models,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.152352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.152352Z digest=sha256:5560d88e5064a837fb5bb9e3c4cd645efe827985ce606acae668112f93b516dc

Observation 921fad93-7cc5-4c14-8671-f21cf653fcb2 · outbound

This paper cites Inner Monologue: Embodied Reasoning through Planning with Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Inner Monologue: Embodied Reasoning through Planning with Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.157203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.157203Z digest=sha256:70c03fb8b1dbe9427e05e303896b5233d8a94b785ad9467bfd18650fe0cb78cb

Observation ba6aa2d7-a84e-4c0f-88e2-76eb8fa93d00 · outbound

This paper cites Enabling intelligent interactions between an agent and an llm: A reinforcement learning approach,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Enabling intelligent interactions between an agent and an llm: A reinforcement learning approach,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.892063Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.162015Z digest=sha256:372f0bd7bb5846990f9277adb54f60a79acf90cec25146cda3b9d8f79b547d44

Observation 90e9c8ea-ab1c-4d35-9c1c-09e51f68285c · outbound

This paper cites Grounding large language models in interactive environments with online reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Grounding large language models in interactive environments with online reinforcement learning,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.874356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.167776Z digest=sha256:f0172cddb616e678a21afd22d5847725b6326cbfe0160966758c35ebedaf55d1

Observation 627dc17b-390e-4f3b-9360-b7d22f48d547 · outbound

This paper cites Introducing gemini: our largest and most capable ai model,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Introducing gemini: our largest and most capable ai model,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.856431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.173907Z digest=sha256:ba48327aedb9be026edd696459fa2943455a16580f7aa36e89d46dc4813a7ec5

Observation dfcedf34-5a29-42cc-844b-085a800a7dfd · outbound

This paper cites Qwen2.5 Technical Report.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Qwen2.5 Technical Report

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.179132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.179132Z digest=sha256:64f27e327d57c15324107c344dd0e7642f87b6b4e30f7f60c6d9a87cf8c9b6a0

Observation 8db894f0-eb4a-4bec-93d9-24ca9e2e60c6 · outbound

This paper cites The claude 3 model family: Opus, sonnet, haiku.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation The claude 3 model family: Opus, sonnet, haiku

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.184370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.184370Z digest=sha256:c8d438f442c13618a01f204ace6699aac0f325639ce599ebf64b43c46ec0d280

Observation c5d046f5-9430-464c-a32b-38894c703de5 · outbound

This paper cites Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.189783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.189783Z digest=sha256:d66ee00e5f9dc9d78fdda8186eeb0d25ace3c2c4e28854426645207847152cdd

Observation f9347ac1-3a04-4b37-87f8-a2a89600d53f · outbound

This paper cites Reward Design with Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Reward Design with Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.196985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.196985Z digest=sha256:5be57f461d25de440de1b438230c833cabebdbf1a3423c5c16848d1d222a1b83

Observation 4541a172-4582-4d2f-91c1-6f0dc5d04da7 · outbound

This paper cites Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.202600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.202600Z digest=sha256:3fc043037fb1d5ab53111a9c488d22d5067668f2d40cf2663853428e6b69da62

Observation d6e0d8eb-dcc5-43a1-8cd8-7c1850be8884 · outbound

This paper cites RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.208656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.208656Z digest=sha256:3b05410d8273eaa5a91ef33f80914b76e72ec228ed9358eb94f1f6d0bda073cc

Observation 79cb93c5-bbab-4fc9-a2e6-0b13b27de1a8 · outbound

This paper cites Voyager: An Open-Ended Embodied Agent with Large Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Voyager: An Open-Ended Embodied Agent with Large Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.214510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.214510Z digest=sha256:7fb6d9399afd6f76be2a1b3a5a9d950eb5e2e5168a2a60a43f32f133a8588414

Observation aa1c2f58-d289-44cb-b677-69551e889f3e · outbound

This paper cites Bootstrap Your Own Skills: Learning to Solve New Tasks with Large Language Model Guidance.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Bootstrap Your Own Skills: Learning to Solve New Tasks with Large Language Model Guidance

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.221259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.221259Z digest=sha256:ddbf0607ec1f600e6288bda80a806e90a84be3ce523be2b8d8163ed9df92a5ac

Observation 8bdc0382-62f0-44ac-9437-0d12274b4263 · outbound

This paper cites Embodiedgpt: Vision-language pre-training via embodied chain of thought,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Embodiedgpt: Vision-language pre-training via embodied chain of thought,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.826830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.226802Z digest=sha256:fe0714b7c1b336d3430cb7b4cf58a3abce8b5358e189ff683a44fb394df7261d

Observation 0c388fba-6c6c-49d7-862e-aad30cc1e6e5 · outbound

This paper cites Vision-Language Models Provide Promptable Representations for Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Vision-Language Models Provide Promptable Representations for Reinforcement Learning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.232110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.232110Z digest=sha256:8ce7cd0187af8f797bef5f2cf44605e14761a43b4f45683661e685d42bbe9c34

Observation 86f2b24e-5c2f-49cb-a5e0-0fa78e362dbe · outbound

This paper cites Policy distillation,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Policy distillation,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.810268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.237652Z digest=sha256:a5bd60eb741331bbe475c1e30f8b0fabd735e2eb331f1e614d9ef58e7d10503c

Observation ff176453-e3da-4a72-8bc3-f890816a73d3 · outbound

This paper cites Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.244006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.244006Z digest=sha256:48cfe739aafbe1d7a13439e4da1f599e0818d4324040be30389536c1a9ea291e

Observation ae662865-6a6f-42fe-b1ad-6f57d153b6d1 · outbound

This paper cites Guided policy search,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Guided policy search,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.793015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.249797Z digest=sha256:0297c9c828346659648809884bc19290408b05a9c7f15e85e05b4b9e2c1e2a17

Observation 44c0d836-a331-474c-9338-6de3c43ae6bb · outbound

This paper cites Neural network dynamics for model-based deep reinforcement learning with model-free fine-tuning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Neural network dynamics for model-based deep reinforcement learning with model-free fine-tuning,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.764856Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.255806Z digest=sha256:72892723dfbc10efc9b14aaedec86c1578f23dba23cee980d14c752a0895df94

Observation 497f7ed1-13c2-4fea-a19c-dea6c2b02efc · outbound

This paper cites Agents teaching agents: a survey on inter-agent transfer learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Agents teaching agents: a survey on inter-agent transfer learning,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.746078Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.260660Z digest=sha256:b3e9fde054b9364fe887f2d9d4b6d7293995d512c3b7d974f513a01baed04cff

Observation 9424baa2-0bc3-4fa1-b8f1-3a8f7965de6d · outbound

This paper cites Reincarnating reinforcement learning: Reusing prior computation to accelerate progress,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Reincarnating reinforcement learning: Reusing prior computation to accelerate progress,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.725844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.265404Z digest=sha256:33f4aa42531dec66232c5c40652f736c6f7fb68905eec44e4e5efec289c5a12a

Observation 7e66c295-55df-46b2-a47f-c04b0a8c8b1d · outbound

This paper cites Kickstarting Deep Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Kickstarting Deep Reinforcement Learning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.270545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.270545Z digest=sha256:5f1da7486303cbbe6543fea7c8e6f93a4ac43c517fb10da012525d200cf6061c

Observation 7ee6f8c5-bf57-4e97-bcb9-0211e6784704 · outbound

This paper cites When does label smoothing help?.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation When does label smoothing help?

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.707149Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.276607Z digest=sha256:82c0ff0a97d46991b217fe965f7825db35986c7ec6adff057ec6cfa57e7ae41e

Observation 1a679df0-1267-4705-a418-1b30313f31c6 · outbound

This paper cites Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal- oriented tasks,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal- oriented tasks,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.688286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:59:41.281514Z digest=sha256:4e71f84fcfe96dd9df1c035048075d251a1fbf54bff1a69be469ad96a8bba6c1

Pith citing papers

No inbound Pith citation observations are available.