Pith. sign in

Paper Citation Record · LEDGER

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization

As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2509.06759.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.06759 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T23:11:33.916383Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T10:06:15.623188Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T03:26:28.843655Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact3
  • verified fuzzy24
  • unresolved17
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 0b7ddbe5-6805-4d44-8d87-936c0c175228 · outbound

This paper cites Visual instruction tuning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Visual instruction tuning,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.758397Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:29.712782Z digest=sha256:21c95d0f15ea3dcacd5921d591b07be7271a9d6fcb2209809470ec436c0fb3c9

Observation 82d881f1-e063-4db4-87d4-7c06c0718ac1 · outbound

This paper cites MiniGPT-4: Enhancing vision-language understanding with advanced large language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization MiniGPT-4: Enhancing vision-language understanding with advanced large language models,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.750942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:29.810781Z digest=sha256:8f1b8bfbb31a539a760a16bfc41f3da90d8fe48355fb99c0a96f54af9c55c8c6

Observation a9705884-29bd-481d-ad90-0883b4698e2a · outbound

This paper cites FuRL: visual-language models as fuzzy rewards for reinforcement learning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization FuRL: visual-language models as fuzzy rewards for reinforcement learning,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.741768Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:29.936043Z digest=sha256:0fdedf99af041126821e19d300a924741b731be1dc366b7436530dc65f43ff1b

Observation 285986a1-08cd-473a-b33e-adbfa20b63a4 · outbound

This paper cites Direct preference optimization: your language model is secretly a reward model,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Direct preference optimization: your language model is secretly a reward model,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.733910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:30.083034Z digest=sha256:ab22c6e475a1526d36e240dfa7ac6f6da3d9c8d6f774e43675509a68448e1d15

Observation 937d651a-f762-4345-9648-4634aaeccb1f · outbound

This paper cites Proximal Policy Optimization Algorithms.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Proximal Policy Optimization Algorithms

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.185541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.185541Z digest=sha256:73963b0566336c85126f9cb1567fc42f80bb2f88516d29f29b16abfc212d4302

Observation 81e810d6-b6a1-4164-b624-1301cfb1878b · outbound

This paper cites Deep reinforcement learning for cyber security,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Deep reinforcement learning for cyber security,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.327881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.327881Z digest=sha256:914703698dc8fae6d645e05c0a21b9417ecc352c7092d318769323ea41eb0d93

Observation 2530fe82-4bf8-404e-b646-29e7b055609f · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.433159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.433159Z digest=sha256:4074c7416ea63078678e61adf9e222dfbfc0b3eba2f0ac4ae7b7f1d48f987376

Observation 5eb4008c-f784-4649-a0cc-4dd41817ff9d · outbound

This paper cites Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.555836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.555836Z digest=sha256:ff5591e1e451d58616400d897c63883cf7ee995225a4f3c9e74a286eff892bbf

Observation 96de6b97-b3f9-44e5-8037-ad88ddfeb846 · outbound

This paper cites GPT-4V(ision) System Card,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization GPT-4V(ision) System Card,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.722313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:30.681453Z digest=sha256:94cab7154b993c1441245acbbb69a7dce4283c280fc2d1585107aec248238bfa

Observation f32b6995-f3cb-4e21-a4d0-c354ea1c84f7 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.789285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.789285Z digest=sha256:88c64597ab6048d5600f94edbc7f21a6ed13d1ecac6ed24cfc3a89c095a14e53

Observation 2b2055ae-7013-4777-aa96-0396d55ff61c · outbound

This paper cites The Claude 3 model family: Opus, Sonnet, Haiku,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization The Claude 3 model family: Opus, Sonnet, Haiku,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.715410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:30.892892Z digest=sha256:ad58697cbdc70a849b98df3dd4a2fcd723a7e79185c0baac01aa53fc06d2f3d7

Observation d4d1a607-5086-4fe1-8c10-dd42cd967546 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.049107Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.049107Z digest=sha256:c7269ebf3bd45d79900e888db234307c85231c74bc4d0074d88e20dc34089ae4

Observation c7afd6ff-f37d-48fc-8971-c23572d2a6f2 · outbound

This paper cites The Llama 3 Herd of Models.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization The Llama 3 Herd of Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.172246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.172246Z digest=sha256:7cb8ef33ddbbee45461f9d695c5f92ad6ec58cfaa6827452b89137afc5ea35e4

Observation 06c642ba-e757-4f1a-b582-dd08acd688e4 · outbound

This paper cites Qwen2.5-VL Technical Report.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Qwen2.5-VL Technical Report

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.322246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.322246Z digest=sha256:2d7da50257ee429505cb0b8b3560af6e8d7792b7d28105731ec4d413b0f63bfe

Observation 6dea6216-c277-41e8-8d9c-deff99a9c82c · outbound

This paper cites The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.707253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:31.455348Z digest=sha256:d03cfcc3486c93413bfd27943c862d5adb84a866821b33df581ab05785f083aa

Observation 05d60a77-9a45-47f1-aa8b-e5d7ef872968 · outbound

This paper cites Aligning large multimodal models with factually augmented RLHF,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Aligning large multimodal models with factually augmented RLHF,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.697317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:31.557083Z digest=sha256:256410278a44658cd6b60325dbe090e4124430f7e29c46e51b5fce6d8ade6b2c

Observation 5515cda2-59b6-4b31-9a73-4a4ed8eef351 · outbound

This paper cites Fusing pre-trained language models with multimodal prompts through reinforcement learning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Fusing pre-trained language models with multimodal prompts through reinforcement learning,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.689442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:31.659056Z digest=sha256:cf57d3d6e5a479c1b0347ba5409128351d8487d3e395c4c4be845726d179b472

Observation eca955ef-ec96-4f6a-bc04-9842a5ae3694 · outbound

This paper cites Learning transferable visual models from natural language supervision,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Learning transferable visual models from natural language supervision,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.774303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.774303Z digest=sha256:75bf12b3a9832962ad29484ffc14c46356bd22101d58c3cccdb5be783dc165e1

Observation 2725aca8-5c7c-48f3-8fbf-57cd903c3e8f · outbound

This paper cites Improving Vision-Language-Action Model with Online Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.875241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.875241Z digest=sha256:13e4428ee17643bd69d5e7c67f4adff58f09a1c15133e17b374f066d8f778d57

Observation 584d7002-35ed-412f-885a-9e1b337db0e4 · outbound

This paper cites Fine-tuning large vision-language models as decision-making agents via reinforcement learning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Fine-tuning large vision-language models as decision-making agents via reinforcement learning,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.678223Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:31.972932Z digest=sha256:555c322a50f7a3dd247c0e69718e4e40bb7325626da64696b9eb322364d6de71

Observation 9dd998c8-ec99-4eb2-951b-5774943f28c6 · outbound

This paper cites VLFeedback: A large-scale AI feedback dataset for large vision-language models alignment,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VLFeedback: A large-scale AI feedback dataset for large vision-language models alignment,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.671740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:32.078379Z digest=sha256:59d89ddebcdb7dcc4f7d19c9b0a60c37953af1ed61e1940b3bb21bd984e0d556

Observation 1e71b9a7-b5a1-432e-9845-65efc072eef0 · outbound

This paper cites MM-RLHF: The Next Step Forward in Multimodal LLM Alignment.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization MM-RLHF: The Next Step Forward in Multimodal LLM Alignment

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.187646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.187646Z digest=sha256:389662a8afe93702eca50eb1117d1db53e90a33eb87c906e9658daa84617dbbc

Observation d62c896b-9f3a-4713-8d08-1799de8b65e5 · outbound

This paper cites Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.319995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.319995Z digest=sha256:6498e19c41fc33113c9b47b35547f67dd04c482f7365596fb67c582b83a6c725

Observation 73f1b11e-3aba-4ab6-9a34-d35332c2bece · outbound

This paper cites Training language models to follow instructions with human feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Training language models to follow instructions with human feedback,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.665282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:32.400862Z digest=sha256:09c71dead3f7c3f0d9308674fe897ce50ebb957d268f3c9d094991d0d02da3c9

Observation dd0286eb-b055-4f36-99dd-9cb8bb277b00 · outbound

This paper cites RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.658696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:32.459930Z digest=sha256:2e139d084c913f3c114307ded665fde38d1599e5c8fc58fd4f3630b2a105a147

Observation 1ed9281b-9ea0-449d-809a-5428edc78ccd · outbound

This paper cites RLAIF-V: Aligning MLLMs through open- source AI feedback for super GPT-4V trustworthiness,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization RLAIF-V: Aligning MLLMs through open- source AI feedback for super GPT-4V trustworthiness,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.518338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.518338Z digest=sha256:205680517bbb42cd836fd9fa415c88ab6acefb23cc08f2fa95602c456f079dbd

Observation 9c0e0dba-87fe-4724-8c9b-7450768ae793 · outbound

This paper cites Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.623370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.623370Z digest=sha256:3fee39267ef90bba772324514661ec2bd2e553a8d7d9ea35741288999fbb2a8f

Observation 4d9d970f-7b5a-4ed0-ba28-4912501b0c8b · outbound

This paper cites Aligning modalities in vision large language models via preference fine-tuning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Aligning modalities in vision large language models via preference fine-tuning,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.652391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:32.712851Z digest=sha256:d6432776f4e05eca9bd3ebb596395f91300a195466e61b3c3a1a55d1aaa1c354

Observation 98be5315-ceb8-4cbd-9ca8-eb2959294c31 · outbound

This paper cites Re-Align: Aligning vision language models via retrieval-augmented direct preference optimization,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Re-Align: Aligning vision language models via retrieval-augmented direct preference optimization,

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-08-04T23:11:34.328168Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:32.788914Z digest=sha256:757836f3759ad3daba5c49b0272f6762ea99808c623a64adb93ae5ee932264cc

Observation 44d826cd-ca6d-4d51-a385-502c419dcf59 · outbound

This paper cites Enhancing visual-language modality alignment in large vision language models via self-improvement,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Enhancing visual-language modality alignment in large vision language models via self-improvement,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.644815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:32.858563Z digest=sha256:8fa3ddecb8ca44acd9c902d5428ef3b0b2e2ba86afbc9ed0944f4e3689d00ce5

Observation 340830de-37de-418f-a89a-309ae2e27376 · outbound

This paper cites VILA: On pre-training for visual language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VILA: On pre-training for visual language models,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.637399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:32.938809Z digest=sha256:85b65d7bd6270bc39ba18a2c1b13e9ca48849233629e344a5b2e461d20448966

Observation 08d7f4a5-692d-40ce-a274-cc75b88179e0 · outbound

This paper cites SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:33.026717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:33.026717Z digest=sha256:8f51fa86be1ce148a7f9f399198636e0e810f911534cb292d0689adda578cd73

Observation cb03875e-d4b2-4db5-be8d-34f9a673557b · outbound

This paper cites DRESS: Instructing large vision-language models to align and interact with humans via natural language feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization DRESS: Instructing large vision-language models to align and interact with humans via natural language feedback,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.629758Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:33.113237Z digest=sha256:a2954922ef2ed4ace41ad6b6bcfd4012d4678207d1159fc1e8f1a775f5764af3

Observation 4f1bbaf7-89cd-4365-bcb9-edf78b7b875c · outbound

This paper cites Active learning for vision-language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Active learning for vision-language models,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.622360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:33.169468Z digest=sha256:ed92cfae06dc7e35cde4a4a4968f9d923eb8568cb26a85a0c4557a7ed10f1537

Observation 947346f9-f031-49f6-8893-3e196311fc20 · outbound

This paper cites S-CLIP: Semi-supervised vision- language learning using few specialist captions,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization S-CLIP: Semi-supervised vision- language learning using few specialist captions,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.614867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:33.253965Z digest=sha256:f82780d1725620b429b071f1f4ef1bf4790c085878d231aa2fc32f90c56774e5

Observation 39cd1753-ca90-4451-b2a6-3e7b88b37ceb · outbound

This paper cites RL-VLM-F: reinforcement learning from vision language foundation model feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization RL-VLM-F: reinforcement learning from vision language foundation model feedback,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.606114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:33.336199Z digest=sha256:a1d4370bb126a5448fb4c485fb120b0bdaae8cbf18e1a60ec38f9490949d1531

Observation 8f86d631-de35-4c62-b3b9-ab9639bc0c06 · outbound

This paper cites VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:33.426693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:33.426693Z digest=sha256:c30f2b1ead124f9ba4f370a3885810c9a03fa636bdf7ac410d91dab701c4cfd4

Observation 50ab2a2b-223e-4db1-a473-b074a11bb0f2 · outbound

This paper cites Text-to-decision agent: Offline meta-reinforcement learning from natural language supervision,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Text-to-decision agent: Offline meta-reinforcement learning from natural language supervision,

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-08-04T23:11:34.192544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:33.506496Z digest=sha256:a948c550139a7b35784ee03150ad4e5d1690c50daaf7a23f41f365e025859343

Observation 275b609a-a0c7-4d8e-87f6-14be0bb1e33e · outbound

This paper cites Zero-shot model-based reinforcement learning using large language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Zero-shot model-based reinforcement learning using large language models,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.492893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:33.588219Z digest=sha256:3995a46e90443bb9d6d4bcf38d94007f4e9d28420ffbdf689c1d11e431083629

Observation 81da2cfc-2953-4d37-9707-0803e844cfca · outbound

This paper cites Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:33.680238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:33.680238Z digest=sha256:ec5b46ea71368a4c8c7b60a7ac1091828e3572d12605b72effd04cdd7dd37189

Observation fb608950-511f-4461-ab83-d883d128b16e · outbound

This paper cites Open-ended VQA benchmarking of vision-language models by exploiting classification datasets and their semantic hierarchy,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Open-ended VQA benchmarking of vision-language models by exploiting classification datasets and their semantic hierarchy,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.213474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:33.749871Z digest=sha256:a6e72a86a573ba85d03874cd5eecdd9d65fbdae93ef481f234b0e3534deb5d5f

Observation b37a8033-2b5a-4f9b-b754-91d30b904049 · outbound

This paper cites VLP: Vision-Language Preference Learning for Embodied Manipulation.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VLP: Vision-Language Preference Learning for Embodied Manipulation

Reference 42

Resolution
verified exact
local_arxiv, observed 2026-08-04T23:11:34.055141Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:33.816944Z digest=sha256:3586c1b3b8aaf5232bc6fa688bf9419d2eb1c8e61601e25ae2a9ec0d2e9f6181

Observation c0650d6e-0169-4640-a19c-fd7cc2086343 · outbound

This paper cites Multi-agent deep reinforcement learning with human strategies,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Multi-agent deep reinforcement learning with human strategies,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:34.879301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:33.871306Z digest=sha256:61cd4f4847fe0b56fb56c061bd5119facdc5fe94edc1d6d277f19b031c9da286

Observation 7336f9a6-1f18-42b4-a64b-401378996dcb · outbound

This paper cites ETA: Evaluating then align- ing safety of vision language models at inference time,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization ETA: Evaluating then align- ing safety of vision language models at inference time,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:34.656421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-04T23:11:33.916383Z digest=sha256:e7e3b0d0bb1d180401a14bfc3aa677d43bd8a4cb0f8e573c2b4ad8e4d21d92a7

Pith citing papers

Observation f4c65fd8-781c-4f7a-88f2-3b0a19ee93ef · inbound

Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding cites this paper.

Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-07-02T03:26:28.845645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-28T10:06:15.623188Z digest=sha256:c6161985d7656bcecbd7b20f32627f8af6e1cba971cb8178da1a6045204ec74c