Pith. sign in

Paper Citation Record · LEDGER

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation

As of 18 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.11221.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.11221 v1

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:59:41.281514Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

50 of 50 outbound references displayed

  • verified exact0
  • verified fuzzy26
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 12b45feb-cf55-4525-be8a-32e6644f08ae · outbound

This paper cites Mastering the game of go with deep neural networks and tree search,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Mastering the game of go with deep neural networks and tree search,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.016760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.016760Z digest=sha256:7d9eb970d7d6459d98c915f89d9fd9f832bd52cbbf923eaa91a63d46846458f1

Observation 374f6784-dfc4-457b-873e-63da11c83dc0 · outbound

This paper cites Advanced planning for autonomous vehicles using reinforcement learning and deep inverse reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Advanced planning for autonomous vehicles using reinforcement learning and deep inverse reinforcement learning,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.197622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.022428Z digest=sha256:85f53af319980dffc6dd104f7260a2fed8669d4eb44db5bda63165dbe26df8b2

Observation 2ada002b-50ab-4b48-999c-61eff2ab90db · outbound

This paper cites Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipu- lation,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipu- lation,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.180669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.027555Z digest=sha256:8c6c4bea9e89392ae90550782697db7c63e063186e8a43ea4b4bfcea73f4e2ce

Observation 88899db3-57af-4c87-973e-c91341cb9213 · outbound

This paper cites Mastering atari, go, chess and shogi by planning with a learned model,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Mastering atari, go, chess and shogi by planning with a learned model,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.161273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.033210Z digest=sha256:8c8b76a36cd0419d77a7e891c9bf7730ad6f95732edc21dabda5812d35c868f0

Observation e761d655-2eb4-46a3-b0a8-a6924722d97d · outbound

This paper cites Hindsight goal ranking on replay buffer for sparse reward environment,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Hindsight goal ranking on replay buffer for sparse reward environment,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.138548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.038495Z digest=sha256:ef618949d63ca3dbf1f562a97764ec4e9066ff99dc311f1e7883e63b4f0a31a9

Observation cacf23d0-8b6d-43f3-afdb-3bcaa311684c · outbound

This paper cites Utilizing skipped frames in action repeats for improving sample efficiency in reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Utilizing skipped frames in action repeats for improving sample efficiency in reinforcement learning,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.116098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.044058Z digest=sha256:ecb596cbd6f50320a0ac69545845b5970d61ffa070d6a05359aba87619758353

Observation 23b1ea9c-e676-46a9-9cc5-63fada2bb3e8 · outbound

This paper cites Predictive coding for decision transformer,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Predictive coding for decision transformer,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.096012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.050425Z digest=sha256:5f265f7572a0aefb28001b70a44585ba00819e932114474225af770792503d93

Observation 6a11b1b3-ac27-41a0-9bfa-2f64ad4911f9 · outbound

This paper cites Dota 2 with Large Scale Deep Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Dota 2 with Large Scale Deep Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.056303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.056303Z digest=sha256:6146749d84064c638673bfef59c7ac1814812aa7e9e2214d22894962ded475ab

Observation e12c152e-d9b1-43e1-abd5-c26168028409 · outbound

This paper cites A comprehensive survey on safe reinforce- ment learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation A comprehensive survey on safe reinforce- ment learning,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.078854Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.061637Z digest=sha256:7bb03cc1d8e1bb784861668965bb8ecba7f5fb5cb1568a3285aaaba2bf92b523

Observation 21454ae8-9264-4d55-b328-08ade17e5816 · outbound

This paper cites No falls, no resets: Reliable humanoid behavior in the darpa robotics challenge,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation No falls, no resets: Reliable humanoid behavior in the darpa robotics challenge,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.060001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.067101Z digest=sha256:721207dd12240233c387217ce900760f3cd13942364fddf406d371ecf56d1a33

Observation 2819d1b1-c94e-4d10-aebe-a8f57790659b · outbound

This paper cites Deep reinforcement learning: A brief survey,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Deep reinforcement learning: A brief survey,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.040985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.071821Z digest=sha256:9ef9fdbfbde6b74062a4bf3bdcdb63e4e4a62d074fe79ab21315bee8b6b7bcfe

Observation 004f6a71-28d9-429f-8bff-8b3771b7e502 · outbound

This paper cites Language models are unsupervised multitask learners,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Language models are unsupervised multitask learners,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.076975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.076975Z digest=sha256:a8ac33d10009a5ef55ed93748a7c490cf189cd598f20efafa70ac56e1622c039

Observation 1a12b399-4e20-4909-9477-33ca8df11950 · outbound

This paper cites Language Models are Few-Shot Learners.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Language Models are Few-Shot Learners

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.082178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.082178Z digest=sha256:c26cf854689609f6730e36cea6db47c0cd15c99341fc5bd704d1bc1104bb41ab

Observation 3b9b039e-4a3d-4c01-98fe-c08c0e227e66 · outbound

This paper cites On the Opportunities and Risks of Foundation Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation On the Opportunities and Risks of Foundation Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.087154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.087154Z digest=sha256:4aaf7aaf8d342e9d7b920ae36b2642e4828a4b4454b2a72ffff2450bdee24a7c

Observation 309e9cdc-7ec7-45f7-8d12-f298c6c72fd6 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.091688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.091688Z digest=sha256:5ac152b4e4fb70eb38eff404de8e60961f00056f18abeedfc31f4ccfd7830cd7

Observation e853ad67-0be1-4149-8690-34eeb5e2efdc · outbound

This paper cites Openai. gpt-4v,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Openai. gpt-4v,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.009167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.097123Z digest=sha256:4648a1072b85b1323dec73566a8f1a55e1d30c6def39c86ef00a6d41f4af600e

Observation 73121656-f8a6-48f4-94f6-cee085346f26 · outbound

This paper cites Do As I Can, Not As I Say: Grounding Language in Robotic Affordances.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Do As I Can, Not As I Say: Grounding Language in Robotic Affordances

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.101775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.101775Z digest=sha256:dfb105947aa4b041f9fb31c73f31addf367a7a292b969e4ea455f71badec38c8

Observation 0887c92a-18f5-4763-9aa5-0fb8b905530d · outbound

This paper cites Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.989419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.106538Z digest=sha256:22af8222beed4f940d60ffccda2f6e05043a663c629b1c42f0a363fe26e5fb86

Observation fcbea04e-e131-4401-9fec-3787d0fbcbee · outbound

This paper cites Large language models as generalizable policies for embodied tasks,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Large language models as generalizable policies for embodied tasks,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.972020Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.111452Z digest=sha256:374f92b15e4f2a66b0fa974d67134dbc81f509330236fe532833871c476a1a5f

Observation e1b7d85e-be24-4f27-acb9-2c7dc0e7d20f · outbound

This paper cites Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.116130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.116130Z digest=sha256:33ccfb4ca72ec8d25ad468a425777c5646b104c12b1e581d48d6e53e515245a1

Observation 399ad55a-72b2-4784-9348-0ab362b99e56 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation LLaMA: Open and Efficient Foundation Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.122020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.122020Z digest=sha256:399574592ff60aefb59d40d16596acb5328498be24ff6058ea5b32eee1639e44

Observation 72b92636-9d51-4181-8bd3-1892a3bd2cb7 · outbound

This paper cites Palm: Scaling language modeling with pathways,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Palm: Scaling language modeling with pathways,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.954129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.126397Z digest=sha256:64dee5de0f450b40a75072b6b23f6afb4765200cb0a9ed8c96b4d51f0cf0bb56

Observation 98407cff-95d8-42a0-8cb6-470690c23c8a · outbound

This paper cites Distilling the Knowledge in a Neural Network.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Distilling the Knowledge in a Neural Network

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.131638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.131638Z digest=sha256:c1c955fd60d9d24d9ae808dc4a6a7bd47a5aac680cfe1defdb3c847cdb0e20d3

Observation 304c07cf-6812-4672-98ba-78a28767842e · outbound

This paper cites Proximal Policy Optimization Algorithms.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Proximal Policy Optimization Algorithms

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.136847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.136847Z digest=sha256:9c4d6192bc0207607389b132121686c0511f0ce0f0b92c4af76c1cf40185035c

Observation 9375b1ad-ebf4-4abd-8857-850b3cbece2d · outbound

This paper cites Asynchronous methods for deep reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Asynchronous methods for deep reinforcement learning,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.936201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.141241Z digest=sha256:43b81c53f3680369cb573a5a603e924583554cfb74cb6618a5263ffcc3d05292

Observation 7ae865fb-960e-4774-9e16-aa28089e8908 · outbound

This paper cites Guiding pretraining in reinforcement learning with large language models,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Guiding pretraining in reinforcement learning with large language models,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.919926Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.147213Z digest=sha256:dd42832f381de307e976ed87af3171482bbba484ebf380573539e96d8b5fc110

Observation cb90abaf-fed4-450d-a731-507c58d1852f · outbound

This paper cites Progprompt: Generating situated robot task plans using large language models,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Progprompt: Generating situated robot task plans using large language models,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.152352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.152352Z digest=sha256:5560d88e5064a837fb5bb9e3c4cd645efe827985ce606acae668112f93b516dc

Observation 921fad93-7cc5-4c14-8671-f21cf653fcb2 · outbound

This paper cites Inner Monologue: Embodied Reasoning through Planning with Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Inner Monologue: Embodied Reasoning through Planning with Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.157203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.157203Z digest=sha256:70c03fb8b1dbe9427e05e303896b5233d8a94b785ad9467bfd18650fe0cb78cb

Observation ba6aa2d7-a84e-4c0f-88e2-76eb8fa93d00 · outbound

This paper cites Enabling intelligent interactions between an agent and an llm: A reinforcement learning approach,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Enabling intelligent interactions between an agent and an llm: A reinforcement learning approach,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.892063Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.162015Z digest=sha256:3b26958389d988ff57d3c6029b7cf0aad10b54405ab861d3f3eae4390dbd3526

Observation 90e9c8ea-ab1c-4d35-9c1c-09e51f68285c · outbound

This paper cites Grounding large language models in interactive environments with online reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Grounding large language models in interactive environments with online reinforcement learning,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.874356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.167776Z digest=sha256:3ee3f8fa8d244e8de5f1f0eb2b8d88398bb41f89ca5bb9ea755f87bf78ac3e7b

Observation 627dc17b-390e-4f3b-9360-b7d22f48d547 · outbound

This paper cites Introducing gemini: our largest and most capable ai model,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Introducing gemini: our largest and most capable ai model,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.856431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.173907Z digest=sha256:899f589e017dc1ec930b82f72bef610695d99b992b640863ecaa1ab926ee7a04

Observation dfcedf34-5a29-42cc-844b-085a800a7dfd · outbound

This paper cites Qwen2.5 Technical Report.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Qwen2.5 Technical Report

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.179132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.179132Z digest=sha256:64f27e327d57c15324107c344dd0e7642f87b6b4e30f7f60c6d9a87cf8c9b6a0

Observation 8db894f0-eb4a-4bec-93d9-24ca9e2e60c6 · outbound

This paper cites The claude 3 model family: Opus, sonnet, haiku.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation The claude 3 model family: Opus, sonnet, haiku

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.184370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.184370Z digest=sha256:c8d438f442c13618a01f204ace6699aac0f325639ce599ebf64b43c46ec0d280

Observation c5d046f5-9430-464c-a32b-38894c703de5 · outbound

This paper cites Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.189783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.189783Z digest=sha256:385318ba33fd3e522d7c061cab640d870d7534c88411bc643fc7422f5a76ca4f

Observation f9347ac1-3a04-4b37-87f8-a2a89600d53f · outbound

This paper cites Reward Design with Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Reward Design with Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.196985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.196985Z digest=sha256:44d5fa80457983577eefdf8f9f0329954e7b55850844b379e29772e627fcce14

Observation 4541a172-4582-4d2f-91c1-6f0dc5d04da7 · outbound

This paper cites Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.202600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.202600Z digest=sha256:3fc043037fb1d5ab53111a9c488d22d5067668f2d40cf2663853428e6b69da62

Observation d6e0d8eb-dcc5-43a1-8cd8-7c1850be8884 · outbound

This paper cites RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.208656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.208656Z digest=sha256:3b05410d8273eaa5a91ef33f80914b76e72ec228ed9358eb94f1f6d0bda073cc

Observation 79cb93c5-bbab-4fc9-a2e6-0b13b27de1a8 · outbound

This paper cites Voyager: An Open-Ended Embodied Agent with Large Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Voyager: An Open-Ended Embodied Agent with Large Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.214510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.214510Z digest=sha256:7fb6d9399afd6f76be2a1b3a5a9d950eb5e2e5168a2a60a43f32f133a8588414

Observation aa1c2f58-d289-44cb-b677-69551e889f3e · outbound

This paper cites Bootstrap Your Own Skills: Learning to Solve New Tasks with Large Language Model Guidance.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Bootstrap Your Own Skills: Learning to Solve New Tasks with Large Language Model Guidance

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.221259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.221259Z digest=sha256:ddbf0607ec1f600e6288bda80a806e90a84be3ce523be2b8d8163ed9df92a5ac

Observation 8bdc0382-62f0-44ac-9437-0d12274b4263 · outbound

This paper cites Embodiedgpt: Vision-language pre-training via embodied chain of thought,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Embodiedgpt: Vision-language pre-training via embodied chain of thought,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.826830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.226802Z digest=sha256:77d7030e56971e71767e05ae6be2cd7cdc3a2f5c2807a574fcc170deac583cb8

Observation 0c388fba-6c6c-49d7-862e-aad30cc1e6e5 · outbound

This paper cites Vision-Language Models Provide Promptable Representations for Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Vision-Language Models Provide Promptable Representations for Reinforcement Learning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.232110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.232110Z digest=sha256:8ce7cd0187af8f797bef5f2cf44605e14761a43b4f45683661e685d42bbe9c34

Observation 86f2b24e-5c2f-49cb-a5e0-0fa78e362dbe · outbound

This paper cites Policy distillation,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Policy distillation,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.810268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.237652Z digest=sha256:d3684e5e22aad0a3fded374ae3075adfbe6c79583b5cdf655b9e8a53c1396e0c

Observation ff176453-e3da-4a72-8bc3-f890816a73d3 · outbound

This paper cites Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.244006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.244006Z digest=sha256:48cfe739aafbe1d7a13439e4da1f599e0818d4324040be30389536c1a9ea291e

Observation ae662865-6a6f-42fe-b1ad-6f57d153b6d1 · outbound

This paper cites Guided policy search,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Guided policy search,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.793015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.249797Z digest=sha256:03b16a076a32d2a1c77519dabe5863c6c962cefc913981d857502bfe42311441

Observation 44c0d836-a331-474c-9338-6de3c43ae6bb · outbound

This paper cites Neural network dynamics for model-based deep reinforcement learning with model-free fine-tuning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Neural network dynamics for model-based deep reinforcement learning with model-free fine-tuning,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.764856Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.255806Z digest=sha256:0a49b051bf1d05e8193ac3d42a558489bc6c60a20044f6e5b8204136d5a03075

Observation 497f7ed1-13c2-4fea-a19c-dea6c2b02efc · outbound

This paper cites Agents teaching agents: a survey on inter-agent transfer learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Agents teaching agents: a survey on inter-agent transfer learning,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.746078Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.260660Z digest=sha256:cda006e74f1bf608825f44a7192d96a99f5e7ebffe0eac735b1c44020d1065c2

Observation 9424baa2-0bc3-4fa1-b8f1-3a8f7965de6d · outbound

This paper cites Reincarnating reinforcement learning: Reusing prior computation to accelerate progress,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Reincarnating reinforcement learning: Reusing prior computation to accelerate progress,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.725844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.265404Z digest=sha256:96e691a088ce57a6f3a7990820417daca329d466a149cebcfab1b3a2601982bd

Observation 7e66c295-55df-46b2-a47f-c04b0a8c8b1d · outbound

This paper cites Kickstarting Deep Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Kickstarting Deep Reinforcement Learning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.270545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.270545Z digest=sha256:5f1da7486303cbbe6543fea7c8e6f93a4ac43c517fb10da012525d200cf6061c

Observation 7ee6f8c5-bf57-4e97-bcb9-0211e6784704 · outbound

This paper cites When does label smoothing help?.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation When does label smoothing help?

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.707149Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.276607Z digest=sha256:e305985c3f304456b74159c02461656eaaf7e25e88d8fa14c1225d6bf3a550a1

Observation 1a679df0-1267-4705-a418-1b30313f31c6 · outbound

This paper cites Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal- oriented tasks,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal- oriented tasks,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.688286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-15T20:59:41.281514Z digest=sha256:94d8f703e8d4b30854b68ba3d8b4917f9691786499f1fbc89f7d6d327d85cc43

Pith citing papers

No inbound Pith citation observations are available.