Pith. sign in

Paper Citation Record · LEDGER

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning

As of 10 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 2 inbound Pith citation observations for arXiv:2502.01616.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01616 v1

Coverage vector

measured 15 of 15 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T14:52:27.301719Z

measured 17 of 17 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-03T12:29:40.316336Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T12:38:07.209843Z

Reference resolution

15 of 15 outbound references displayed

  • verified exact1
  • verified fuzzy3
  • unresolved11
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 89384354-e872-455e-bf1e-cc4fd718b371 · outbound

This paper cites PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.258667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.258667Z digest=sha256:8c5ae18756f1adee47e9bbb05065aab4b835d05420fd376c29f5b019c7c0e32c

Observation dbb1aac8-dc7b-4ed0-ac89-f2ea6a603a04 · outbound

This paper cites Observations are captured from Camera 2 and rendered as 300 × 300 images.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Observations are captured from Camera 2 and rendered as 300 × 300 images

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:52:27.527087Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:52:27.296742Z digest=sha256:5f3d18dee38a1e1c64b7e56d86918a01e1e248f0f579228a0a5fe51e889deb65

Observation 77236849-523e-4e1c-b1f1-6242a4f10ca2 · outbound

This paper cites Self-Instruct: Aligning Language Models with Self-Generated Instructions.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Self-Instruct: Aligning Language Models with Self-Generated Instructions

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.285507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.285507Z digest=sha256:da0f476074bd1a9c9d5ca310ef85ce3e576f381bf1b128837c022ba79033216b

Observation af46d44e-5259-47e5-8105-601d6c61ea28 · outbound

This paper cites Language to Rewards for Robotic Skill Synthesis.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Language to Rewards for Robotic Skill Synthesis

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.291056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.291056Z digest=sha256:4943db2974f1c4ed89fd0ab0ecbc154b9f436ca4e839ff32d9d437a805321efd

Observation 1a9940bf-a6dd-433e-b83f-9670b9018ae3 · outbound

This paper cites RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences

Reference 1952

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.233425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.233425Z digest=sha256:6534d47d61ae4e7d5c9f4e72a0ff3913eedc3d5e0eff293aa2889afb4d62c9b2

Observation bda703ef-bb9d-483f-997b-2915c27a2829 · outbound

This paper cites Language Reward Modulation for Pretraining Reinforcement Learning.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Language Reward Modulation for Pretraining Reinforcement Learning

Reference 2004

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.228163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.228163Z digest=sha256:9d6088116e8297715592cc3a44704ada4f2f42b6db6aa351e2081a3a2a4c44a1

Observation 52287843-3473-4c86-9fc4-9eb2057dcd50 · outbound

This paper cites AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos

Reference 2009

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.279746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.279746Z digest=sha256:e4eab2ed978a8c43fe0c8b09f3e82f5d9d2464055883855afdc79826156813f4

Observation b38c1319-5ace-4761-a5d0-bd20207763c1 · outbound

This paper cites FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning

Reference 2016

Resolution
verified exact
local_arxiv, observed 2026-08-09T14:52:27.463179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:52:27.243627Z digest=sha256:7f02bae4aaa03247e81f1186c1d69beb6d773cd559e892a17840b8204ba3d77a

Observation 0ed0ae6f-3252-4204-8da8-5239a319dd4d · outbound

This paper cites an unresolved cited work.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Unresolved cited work

Reference 2018

Resolution
unresolved
raw_fallback, observed 2026-08-09T14:52:27.541954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:52:27.249102Z digest=sha256:8f98bd1e804f7d0bebd7c7ff4c506faf4c3fdeef54096d72e5b4109034d74a3e

Observation a09a5944-7778-4f91-a051-5a4b14dfcfad · outbound

This paper cites Eureka: Human-Level Reward Design via Coding Large Language Models.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Eureka: Human-Level Reward Design via Coding Large Language Models

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.263884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.263884Z digest=sha256:eca5bfcac66914ca077905865ff3a87f4b7f4605cea8c8d62528d0a52cb13a81

Observation 5df212af-6864-4c05-bcde-c381e175389c · outbound

This paper cites Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.274360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.274360Z digest=sha256:23f4fdec7c07729a8960825e18f3e7c3445d145c5f42285e817e0c87149dcc7d

Observation fd6314a9-eb3e-4343-9c59-039a6a44a791 · outbound

This paper cites SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.269468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.269468Z digest=sha256:fbd8a2e094ced5f50f2ad10b7149ed4512cde7aeb8bbfa95422e28828d697f7c

Observation 2d1278a0-fa7f-4c21-85a8-724fb267ccb1 · outbound

This paper cites Adam: A Method for Stochastic Optimization.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Adam: A Method for Stochastic Optimization

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.253504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.253504Z digest=sha256:b69dbac48316a3af50f599cd707ed3d330a423b94fd66f7e6ef8b3dc68ce3fca

Observation 6333525d-a069-470e-a3c0-ad5c063c3b37 · outbound

This paper cites L., Faust, A., Fiser, M., and Francis, A.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning L., Faust, A., Fiser, M., and Francis, A

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:52:27.556361Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:52:27.238592Z digest=sha256:c1b41676516c073cde867bc5e944eb7b432e0ef234c2532d4d65881c843bbeee

Observation 8d897723-7d68-4c35-bf67-316560bffee0 · outbound

This paper cites The reward model is trained with a learning rate of 0.0003, a batch size of 128, and 200 update steps per iteration.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning The reward model is trained with a learning rate of 0.0003, a batch size of 128, and 200 update steps per iteration

Reference 3000

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:52:27.510462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:52:27.301719Z digest=sha256:f556276f5ce7ab814cd2329477c089cea98c5f362d93cc6e1373089d9ee45255

Pith citing papers

Observation 221239e0-a543-4473-9f65-15c87a0442a3 · inbound

Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations cites this paper.

Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-22T05:34:40.346889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T05:32:17.780012Z digest=sha256:295b24aff771bf4a3da783da2a4fc511aa997f3ce5a2a47033b7112e62a74ef9

Observation da783f53-7c16-476c-8fa3-c88d44d7d78e · inbound

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning cites this paper.

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning

Reference 83

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T12:38:07.211254Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-07-03T12:29:40.316336Z digest=sha256:a46408f633536798edb1891bdeccc774631fd9db47c0c3606693f7894d1b7969