Pith. sign in

Paper Citation Record · LEDGER

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization

As of 15 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2509.06759.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.06759 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T23:11:33.916383Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T10:06:15.623188Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T03:26:28.843655Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact3
  • verified fuzzy24
  • unresolved17
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 0b7ddbe5-6805-4d44-8d87-936c0c175228 · outbound

This paper cites Visual instruction tuning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Visual instruction tuning,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.758397Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:29.712782Z digest=sha256:8fff1f400bf08c023939e595b5c95608f7cf2159cf17a4e816908039105c97de

Observation 82d881f1-e063-4db4-87d4-7c06c0718ac1 · outbound

This paper cites MiniGPT-4: Enhancing vision-language understanding with advanced large language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization MiniGPT-4: Enhancing vision-language understanding with advanced large language models,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.750942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:29.810781Z digest=sha256:2e7ea8bb81647f9dbacc3c8df4414ba213707f9b4c9e8029c54b933065eaa3dc

Observation a9705884-29bd-481d-ad90-0883b4698e2a · outbound

This paper cites FuRL: visual-language models as fuzzy rewards for reinforcement learning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization FuRL: visual-language models as fuzzy rewards for reinforcement learning,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.741768Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:29.936043Z digest=sha256:0096d8c500041c9b1ceef45196e87ff8e85572185616b246a1a82bd3a5e7b76e

Observation 285986a1-08cd-473a-b33e-adbfa20b63a4 · outbound

This paper cites Direct preference optimization: your language model is secretly a reward model,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Direct preference optimization: your language model is secretly a reward model,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.733910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:30.083034Z digest=sha256:4e24092a30b33a64fea03ab962a91b5bcad6333851bc7e41443128697bd4435c

Observation 937d651a-f762-4345-9648-4634aaeccb1f · outbound

This paper cites Proximal Policy Optimization Algorithms.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Proximal Policy Optimization Algorithms

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.185541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.185541Z digest=sha256:73963b0566336c85126f9cb1567fc42f80bb2f88516d29f29b16abfc212d4302

Observation 81e810d6-b6a1-4164-b624-1301cfb1878b · outbound

This paper cites Deep reinforcement learning for cyber security,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Deep reinforcement learning for cyber security,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.327881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.327881Z digest=sha256:914703698dc8fae6d645e05c0a21b9417ecc352c7092d318769323ea41eb0d93

Observation 2530fe82-4bf8-404e-b646-29e7b055609f · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.433159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.433159Z digest=sha256:4074c7416ea63078678e61adf9e222dfbfc0b3eba2f0ac4ae7b7f1d48f987376

Observation 5eb4008c-f784-4649-a0cc-4dd41817ff9d · outbound

This paper cites Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.555836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.555836Z digest=sha256:077d91b0fc51ca78e1b2efc08b12ef04a31a31243bb1c65487dae3411e4469a4

Observation 96de6b97-b3f9-44e5-8037-ad88ddfeb846 · outbound

This paper cites GPT-4V(ision) System Card,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization GPT-4V(ision) System Card,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.722313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:30.681453Z digest=sha256:ebfa40fc608520cf9803169e740987daebe37d328fdb742e05251e9810c35749

Observation f32b6995-f3cb-4e21-a4d0-c354ea1c84f7 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.789285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.789285Z digest=sha256:bac9d7236b85aadaaaff2dd27a4fd4286ff8fd56bbfe8e41955684163daf63c3

Observation 2b2055ae-7013-4777-aa96-0396d55ff61c · outbound

This paper cites The Claude 3 model family: Opus, Sonnet, Haiku,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization The Claude 3 model family: Opus, Sonnet, Haiku,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.715410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:30.892892Z digest=sha256:5794f52a63ddd63bbfede90cc264d862fa3ac2d6c826689dd8e68aedd4d22ed5

Observation d4d1a607-5086-4fe1-8c10-dd42cd967546 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.049107Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.049107Z digest=sha256:e1806efaf7165841e938f1983ace0f7f3238d2f8a8370cbc18eed6e3c5e92706

Observation c7afd6ff-f37d-48fc-8971-c23572d2a6f2 · outbound

This paper cites The Llama 3 Herd of Models.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization The Llama 3 Herd of Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.172246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.172246Z digest=sha256:fee39994324c72e6cece99b866fbba3f4fb24ff8d224907d2b8028e4957e5a78

Observation 06c642ba-e757-4f1a-b582-dd08acd688e4 · outbound

This paper cites Qwen2.5-VL Technical Report.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Qwen2.5-VL Technical Report

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.322246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.322246Z digest=sha256:fb2410cfcccc789d10e7bab8dd08e1507add4877613823268b7b7e9cb834beef

Observation 6dea6216-c277-41e8-8d9c-deff99a9c82c · outbound

This paper cites The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.707253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:31.455348Z digest=sha256:5484e53753a23416eda3f5570c7e17269827a864b26a6619d6309d5c9c207345

Observation 05d60a77-9a45-47f1-aa8b-e5d7ef872968 · outbound

This paper cites Aligning large multimodal models with factually augmented RLHF,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Aligning large multimodal models with factually augmented RLHF,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.697317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:31.557083Z digest=sha256:8970b2f231aea0e28783e72aedc237648471f4440f8310f20dad7bb61e89a7a2

Observation 5515cda2-59b6-4b31-9a73-4a4ed8eef351 · outbound

This paper cites Fusing pre-trained language models with multimodal prompts through reinforcement learning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Fusing pre-trained language models with multimodal prompts through reinforcement learning,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.689442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:31.659056Z digest=sha256:88d28ebea843524fd47230271708ade527fad3981958b52e63015bf7fca91ca5

Observation eca955ef-ec96-4f6a-bc04-9842a5ae3694 · outbound

This paper cites Learning transferable visual models from natural language supervision,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Learning transferable visual models from natural language supervision,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.774303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.774303Z digest=sha256:75bf12b3a9832962ad29484ffc14c46356bd22101d58c3cccdb5be783dc165e1

Observation 2725aca8-5c7c-48f3-8fbf-57cd903c3e8f · outbound

This paper cites Improving Vision-Language-Action Model with Online Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.875241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.875241Z digest=sha256:57ff47a7486afe27615f0b7b7ff65adafb2c066730780a0721d0cb412d5f18a5

Observation 584d7002-35ed-412f-885a-9e1b337db0e4 · outbound

This paper cites Fine-tuning large vision-language models as decision-making agents via reinforcement learning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Fine-tuning large vision-language models as decision-making agents via reinforcement learning,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.678223Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:31.972932Z digest=sha256:404124b526b815a07ef49a24cc3932b12a7bd2f08f1d02d39934e0eb682fd17c

Observation 9dd998c8-ec99-4eb2-951b-5774943f28c6 · outbound

This paper cites VLFeedback: A large-scale AI feedback dataset for large vision-language models alignment,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VLFeedback: A large-scale AI feedback dataset for large vision-language models alignment,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.671740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:32.078379Z digest=sha256:904330aaafc86f17bd701c5e35192c2e12e8bf9289482c340d09d7a425fbdba1

Observation 1e71b9a7-b5a1-432e-9845-65efc072eef0 · outbound

This paper cites MM-RLHF: The Next Step Forward in Multimodal LLM Alignment.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization MM-RLHF: The Next Step Forward in Multimodal LLM Alignment

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.187646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.187646Z digest=sha256:389662a8afe93702eca50eb1117d1db53e90a33eb87c906e9658daa84617dbbc

Observation d62c896b-9f3a-4713-8d08-1799de8b65e5 · outbound

This paper cites Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.319995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.319995Z digest=sha256:cb515e71a6febedd43f809a28ca000ed6ab3b476fc0a742f32892f238995dde1

Observation 73f1b11e-3aba-4ab6-9a34-d35332c2bece · outbound

This paper cites Training language models to follow instructions with human feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Training language models to follow instructions with human feedback,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.665282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:32.400862Z digest=sha256:44472f1e53c7cc11338040729c01c3faaf3704a34661528f901927f64d49c342

Observation dd0286eb-b055-4f36-99dd-9cb8bb277b00 · outbound

This paper cites RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.658696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:32.459930Z digest=sha256:6342347f825c8792d06093c352b500a9048bc0ad943f90c57351a6f386d5098c

Observation 1ed9281b-9ea0-449d-809a-5428edc78ccd · outbound

This paper cites RLAIF-V: Aligning MLLMs through open- source AI feedback for super GPT-4V trustworthiness,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization RLAIF-V: Aligning MLLMs through open- source AI feedback for super GPT-4V trustworthiness,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.518338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.518338Z digest=sha256:205680517bbb42cd836fd9fa415c88ab6acefb23cc08f2fa95602c456f079dbd

Observation 9c0e0dba-87fe-4724-8c9b-7450768ae793 · outbound

This paper cites Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.623370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.623370Z digest=sha256:b8b9cd4260c7a8d282d7ddb415457964629f16a6430d373af2003eaf7114e9cf

Observation 4d9d970f-7b5a-4ed0-ba28-4912501b0c8b · outbound

This paper cites Aligning modalities in vision large language models via preference fine-tuning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Aligning modalities in vision large language models via preference fine-tuning,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.652391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:32.712851Z digest=sha256:4d5b6ef3b09b581ed3984d8d3c96aac25fe8c37c0543f56f2643cb42b1c7ab31

Observation 98be5315-ceb8-4cbd-9ca8-eb2959294c31 · outbound

This paper cites Re-Align: Aligning vision language models via retrieval-augmented direct preference optimization,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Re-Align: Aligning vision language models via retrieval-augmented direct preference optimization,

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-08-04T23:11:34.328168Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:32.788914Z digest=sha256:bc64c7f9c0fa14b42550087dd0d538efb543699c3f1167c2d6f58ba67ff6033c

Observation 44d826cd-ca6d-4d51-a385-502c419dcf59 · outbound

This paper cites Enhancing visual-language modality alignment in large vision language models via self-improvement,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Enhancing visual-language modality alignment in large vision language models via self-improvement,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.644815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:32.858563Z digest=sha256:a2fafefadfcda64f4f84c38ad2fc45ee90fd3171ba5758c7a3cd8b9e8d5ff46a

Observation 340830de-37de-418f-a89a-309ae2e27376 · outbound

This paper cites VILA: On pre-training for visual language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VILA: On pre-training for visual language models,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.637399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:32.938809Z digest=sha256:b265a28da73e4da33cf1703e7fd02d689e703aced00f6da99689e41770e77c41

Observation 08d7f4a5-692d-40ce-a274-cc75b88179e0 · outbound

This paper cites SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:33.026717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:33.026717Z digest=sha256:db1f5b1f1f757b7bc758a8250dc61cca00a11618c697a7aca0345768c63181e8

Observation cb03875e-d4b2-4db5-be8d-34f9a673557b · outbound

This paper cites DRESS: Instructing large vision-language models to align and interact with humans via natural language feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization DRESS: Instructing large vision-language models to align and interact with humans via natural language feedback,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.629758Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:33.113237Z digest=sha256:9572a93e1fe9f6ab93515ef333d2f239943ef2b7e7717ff140716760e18ff031

Observation 4f1bbaf7-89cd-4365-bcb9-edf78b7b875c · outbound

This paper cites Active learning for vision-language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Active learning for vision-language models,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.622360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:33.169468Z digest=sha256:328aed6643e07f9b2ff3f176ed601c9402a966451ff2c9eb6d26c82871190033

Observation 947346f9-f031-49f6-8893-3e196311fc20 · outbound

This paper cites S-CLIP: Semi-supervised vision- language learning using few specialist captions,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization S-CLIP: Semi-supervised vision- language learning using few specialist captions,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.614867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:33.253965Z digest=sha256:460cf248fb75a4b231fba196c4d697b906c7e4ef6fdc4389dfb8444138d70dcd

Observation 39cd1753-ca90-4451-b2a6-3e7b88b37ceb · outbound

This paper cites RL-VLM-F: reinforcement learning from vision language foundation model feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization RL-VLM-F: reinforcement learning from vision language foundation model feedback,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.606114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:33.336199Z digest=sha256:26d42473652761c4e426c78e7805045c309dd5032fc0e352f255af750fa86523

Observation 8f86d631-de35-4c62-b3b9-ab9639bc0c06 · outbound

This paper cites VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:33.426693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:33.426693Z digest=sha256:c30f2b1ead124f9ba4f370a3885810c9a03fa636bdf7ac410d91dab701c4cfd4

Observation 50ab2a2b-223e-4db1-a473-b074a11bb0f2 · outbound

This paper cites Text-to-decision agent: Offline meta-reinforcement learning from natural language supervision,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Text-to-decision agent: Offline meta-reinforcement learning from natural language supervision,

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-08-04T23:11:34.192544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:33.506496Z digest=sha256:33ad59f244803b091ea48561d7ba420c2db341ca26fd1dca230d5723f117aaa4

Observation 275b609a-a0c7-4d8e-87f6-14be0bb1e33e · outbound

This paper cites Zero-shot model-based reinforcement learning using large language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Zero-shot model-based reinforcement learning using large language models,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.492893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:33.588219Z digest=sha256:b7d34866ea815c1d7545aec2df065afc5fae583dbfda07cfc1e89f78b69f5c9c

Observation 81da2cfc-2953-4d37-9707-0803e844cfca · outbound

This paper cites Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:33.680238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:33.680238Z digest=sha256:ec5b46ea71368a4c8c7b60a7ac1091828e3572d12605b72effd04cdd7dd37189

Observation fb608950-511f-4461-ab83-d883d128b16e · outbound

This paper cites Open-ended VQA benchmarking of vision-language models by exploiting classification datasets and their semantic hierarchy,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Open-ended VQA benchmarking of vision-language models by exploiting classification datasets and their semantic hierarchy,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.213474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:33.749871Z digest=sha256:520ea68a6d3e56a39b6144157b362944fefaa21c0925edc73e18332e927733c6

Observation b37a8033-2b5a-4f9b-b754-91d30b904049 · outbound

This paper cites VLP: Vision-Language Preference Learning for Embodied Manipulation.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VLP: Vision-Language Preference Learning for Embodied Manipulation

Reference 42

Resolution
verified exact
local_arxiv, observed 2026-08-04T23:11:34.055141Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:33.816944Z digest=sha256:30f90d00365a830622b59ccd408c4b35eaa427643afbf6d9a18841385613a778

Observation c0650d6e-0169-4640-a19c-fd7cc2086343 · outbound

This paper cites Multi-agent deep reinforcement learning with human strategies,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Multi-agent deep reinforcement learning with human strategies,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:34.879301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:33.871306Z digest=sha256:80119238ca115a12096e8738b912aaf44489fd07c053558a8bcf8c618b2ae242

Observation 7336f9a6-1f18-42b4-a64b-401378996dcb · outbound

This paper cites ETA: Evaluating then align- ing safety of vision language models at inference time,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization ETA: Evaluating then align- ing safety of vision language models at inference time,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:34.656421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-04T23:11:33.916383Z digest=sha256:84aa1cd03f3c0eb7e0d29535118efb1e1ca6dd4ca78894bcc0f0924ed5978fda

Pith citing papers

Observation f4c65fd8-781c-4f7a-88f2-3b0a19ee93ef · inbound

Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding cites this paper.

Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-07-02T03:26:28.845645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-28T10:06:15.623188Z digest=sha256:ec1f8cf80271dc41c6d4fbdb71a57c39e9939b57b5682322a969d42eeb2052b7