Pith. sign in

Paper Citation Record · LEDGER

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

As of 17 August 2026, this Paper Citation Record lists 100 of 145 outbound references and 5 inbound Pith citation observations for arXiv:2412.19326.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.19326 v2

Coverage vector

measured 100 of 145 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T00:47:12.490079Z

measured 105 of 105 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T05:42:52.030381Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-17T02:52:20.802634Z

Reference resolution

100 of 145 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved99
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9dcb825f-4a07-478f-a8e6-852011335249 · outbound

This paper cites GPT-4 Technical Report.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.038424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.038424Z digest=sha256:33de175ee505ad6676cba0b853126396073b10c8387e0f1f522f114a7ddd2c72

Observation 762f1c23-3290-47f3-8dc5-755aefd961c1 · outbound

This paper cites OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.043981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.043981Z digest=sha256:c3665509e168821108a590c1ea5d3b921955167820a15dec548b7895b554eccd

Observation efa4fd45-a338-41c0-b712-a49a9d2a9a93 · outbound

This paper cites Qwen Technical Report.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Qwen Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.049215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.049215Z digest=sha256:122c1a75c33d308bd2eadce7c5ba9bb198af24b73d7964346cae2ce5ccd622d1

Observation 67b764e6-ebbf-45d8-b686-1d2f6f81c332 · outbound

This paper cites One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.054302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.054302Z digest=sha256:a280ddb09771aa9ee14d793ba26248a0e2a744149de5ee4a56bc576042ba05ae

Observation f21a84f0-3855-42c1-9209-28ef34555fb3 · outbound

This paper cites Fully-convolutional siamese networks for object tracking.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Fully-convolutional siamese networks for object tracking

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.059072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.059072Z digest=sha256:749f7a0110158a921626b08c83e10b750047e90a64534b5bb2f80ebef865f320

Observation 4a7d8b0f-fdfc-451a-88c0-57cdf44b2830 · outbound

This paper cites Activitynet: A large-scale video benchmark for human activity understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Activitynet: A large-scale video benchmark for human activity understanding

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.063969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.063969Z digest=sha256:443f8439e33430bcf4f7553b0eea626542a3f45ba770a0ae7bc7baf68aa163d7

Observation cb805870-40c4-4245-a772-0fb8138759ad · outbound

This paper cites Fengwu: Pushing the skillful global medium- range weather forecast beyond 10 days lead.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Fengwu: Pushing the skillful global medium- range weather forecast beyond 10 days lead

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.068513Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.068513Z digest=sha256:7d7b5ff4d05105df9f625d4c4195f35d25fd472913044f44c6e033156d6714b5

Observation bd164ced-73d1-4608-84b4-3ec7f999f3a2 · outbound

This paper cites Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.073445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.073445Z digest=sha256:ff76b04575ef479d2dcb923c8ff6703f0d19062a1fedb6a0bb37e5a2650ca74c

Observation b6c2acca-666b-4c43-a27b-fc5c8a996300 · outbound

This paper cites ShareGPT4V: Improving Large Multi-Modal Models with Better Captions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment ShareGPT4V: Improving Large Multi-Modal Models with Better Captions

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.078413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.078413Z digest=sha256:e2a444bfc668c0639abd9802abc7e371c45af2a7a9a382ebdb414fc404475320

Observation 052ffdf0-131c-43b2-873f-1e6212d75485 · outbound

This paper cites Sharegpt4v: Improving large multi-modal models with better captions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Sharegpt4v: Improving large multi-modal models with better captions

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.083108Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.083108Z digest=sha256:11df5907e29f42e3439a2758ca308dcc7b0f24321cb762bf9dedebf914a9f3f4

Observation 6c4c4aab-e7c2-4666-a51d-e9e39f8c8b7a · outbound

This paper cites ShareGPT4Video: Improving Video Understanding and Generation with Better Captions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment ShareGPT4Video: Improving Video Understanding and Generation with Better Captions

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.087492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.087492Z digest=sha256:65dfc8d5dcfc149f9c5e3e1e171df921bac7de831461a3141508c15253cbe1a2

Observation 2d1d871c-f622-416a-a8cb-99956a10c789 · outbound

This paper cites A simple framework for contrastive learn- ing of visual representations.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment A simple framework for contrastive learn- ing of visual representations

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.092084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.092084Z digest=sha256:12904910b82e5e44f7d3fa93f5fc81b0829f3fd6bdcc19d3b681e83830177a68

Observation 725111f0-c607-4934-aabc-5aae54cb1bef · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.096385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.096385Z digest=sha256:787106b7ad1c57540b365b22cdc495fe15fff70f0f2ae9efdb83c900ae018919

Observation 96e0e322-71e4-4521-9393-77405d9a80ae · outbound

This paper cites Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.100651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.100651Z digest=sha256:2c26f1d13da6f4b14ddfac054ab1be0c89a0719a170df68a7a7089d53bf307ec

Observation 87b74af6-5723-46e1-863c-b056a89acf75 · outbound

This paper cites Atom: Accurate tracking by overlap maximization.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Atom: Accurate tracking by overlap maximization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.104936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.104936Z digest=sha256:e67ed62b3d3d2534648ebcb45fe404adc33ba9c6fb96f8dd8f4f026c5884fcea

Observation 56b2fe7b-5ba8-42ed-a39b-18312df4226e · outbound

This paper cites A thousand frames in just a few words: Lingual description of videos through latent topics and sparse object stitching.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment A thousand frames in just a few words: Lingual description of videos through latent topics and sparse object stitching

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.108967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.108967Z digest=sha256:430b8c958d75576ecd86c740f96c545b97ef4270b7d42e89c6e221b2a4d0db59

Observation 00310f74-8531-48f9-9c63-14b0144895d4 · outbound

This paper cites MeViS: A large-scale benchmark for video segmentation with motion expressions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment MeViS: A large-scale benchmark for video segmentation with motion expressions

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.113554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.113554Z digest=sha256:083b77871ebdd4f2eef1d8fb71affe3dcf49596f9aa79bb3d49eb14909474282

Observation 1840cf52-86e3-452e-8ca4-4fdc90c06e0f · outbound

This paper cites InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.117807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.117807Z digest=sha256:17cde102a4289df84ae13c91f00d6bfbccb9932644417ab2f1073cf62eed2954

Observation da3f08b3-c0d2-4455-a27d-9daa61268863 · outbound

This paper cites Palm-e: An embodied multimodal language model.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Palm-e: An embodied multimodal language model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.122233Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.122233Z digest=sha256:5e8f0ec9885e08d31a5c3d064a7672a3643d78723bbc25add9e35846a2a3a7cf

Observation c1215d70-ce8b-46aa-b293-e19a678c0ff2 · outbound

This paper cites Lasot: A high-quality benchmark for large-scale sin- gle object tracking.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Lasot: A high-quality benchmark for large-scale sin- gle object tracking

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.126482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.126482Z digest=sha256:f3cd1743b99bc4e5ae1b2e039b6f936200eb7f0d5a2c1f41ab57cfbdef228919

Observation 527dba99-44c9-4d31-a891-4e245b4bf354 · outbound

This paper cites Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.130622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.130622Z digest=sha256:a5e762cacc06426d4a408a401fb2ec1a3152c6b4bae3441e5b362bd8ccaac662

Observation e6eb339c-e42c-414f-af2a-c9450e2702c8 · outbound

This paper cites An empirical study of end-to-end video-language transformers with masked vi- sual modeling.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment An empirical study of end-to-end video-language transformers with masked vi- sual modeling

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.134927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.134927Z digest=sha256:20696dd13462c72ea1ddc55038d2a6676377476dd22f6a9d39ee35438ce932af

Observation 3374056e-b088-4018-b786-f7c624f794a8 · outbound

This paper cites Tall: Temporal activity localization via language query.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Tall: Temporal activity localization via language query

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.139026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.139026Z digest=sha256:9539a9de95596410035d8fc49ff04ac81c3c6ccf953b8609acdc6429ff8c4cb5

Observation a8c44783-2dfe-4ecd-b387-d1d18ecdbc36 · outbound

This paper cites Ego4d: Around the world in 3,000 hours of egocentric video.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Ego4d: Around the world in 3,000 hours of egocentric video

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.143090Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.143090Z digest=sha256:da967e5c5c8c6b90dfd6f8630f9490cd4271275e1f59d40d7b5c0ff7880e496d

Observation fa62e8f4-d0c9-4074-af60-e8cad2739f49 · outbound

This paper cites Momentum contrast for unsupervised visual rep- resentation learning.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Momentum contrast for unsupervised visual rep- resentation learning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.147570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.147570Z digest=sha256:00b0d7bb845126075bc1a733ca52254c582ced6e29f3767765981a1686408da2

Observation b2db24cf-c442-4e89-aca1-d867c3a2d165 · outbound

This paper cites Localizing mo- ments in video with natural language.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Localizing mo- ments in video with natural language

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.151828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.151828Z digest=sha256:07668b938e29cd3b70212d47ab7a9b4306b15c8e0e1e61f6d969644b5f200569

Observation 4df2d7f4-754d-4078-a66e-3755084cec88 · outbound

This paper cites Lora: Low- rank adaptation of large language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Lora: Low- rank adaptation of large language models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.155987Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.155987Z digest=sha256:f9f66b22d543437df12f626fc4d9c240e0445376badab26ec71bf7b8c34e3d66

Observation 1d862bc8-9fcb-48d3-90be-7c045f2f791c · outbound

This paper cites Vtimellm: Empower llm to grasp video mo- ments.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Vtimellm: Empower llm to grasp video mo- ments

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.160300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.160300Z digest=sha256:6e667d5a6edf41c8a49fe74cfd1658662d756481aa4abfdf1ca83daa06289ca6

Observation 174cdd31-72e7-49ff-ba71-2709e7ff8943 · outbound

This paper cites Got-10k: A large high-diversity benchmark for generic object tracking in the wild.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Got-10k: A large high-diversity benchmark for generic object tracking in the wild

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.164547Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.164547Z digest=sha256:50eeae58dcff91d01c0224c6a2da55d5e0a8f3ba59a328dc6cde6290f22cb5a6

Observation 91aadbb5-b327-43ee-9673-e360eb89370d · outbound

This paper cites Mistral 7B.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Mistral 7B

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.168965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.168965Z digest=sha256:38c325e23a3f476de88f954caac2e4d7ea0d2f81333f304257913db356b358a8

Observation 4588e631-24e4-463b-abcb-8cbbfa43e80f · outbound

This paper cites Sparse sharing relation network for panoptic driving perception.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Sparse sharing relation network for panoptic driving perception

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.173790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.173790Z digest=sha256:c3f36d1634a97af5cff0f8483673c533d489e2dc516f1ddeb4ef56e96a1914cd

Observation ac1519dd-4912-4649-9aad-a73762a0f331 · outbound

This paper cites Chat-univi: Unified visual representation em- powers large language models with image and video under- standing.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Chat-univi: Unified visual representation em- powers large language models with image and video under- standing

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.178188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.178188Z digest=sha256:68e9768ced22febc819817d7a05f7507f0b6dd78afd115af1430d9e4dbfcb6ff

Observation 6a1416b0-dba8-4eb8-a22a-a93777d61210 · outbound

This paper cites Language Repository for Long Video Understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Language Repository for Long Video Understanding

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.182626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.182626Z digest=sha256:6d6e2f801b68afc79dab5bfa55add7cb52e12905020411170fecbc843b178e88

Observation d4a16e49-f30d-4f47-a61e-da87de2b95c4 · outbound

This paper cites Bert: Pre-training of deep bidirectional trans- formers for language understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Bert: Pre-training of deep bidirectional trans- formers for language understanding

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.188728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.188728Z digest=sha256:a086e2043e7491d26948689b6aa270ae89eeb419b67f5b56f135765b89ef5c90

Observation dc741ad8-f90d-4201-a667-e11909356d96 · outbound

This paper cites Segment anything.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Segment anything

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.193172Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.193172Z digest=sha256:860e2a4bed83eb6d42bdd8de850f945b35b013920ab209a6bdc1c11a33742220

Observation 4d1eee41-3aba-419b-84d6-b2f9c1ed9a02 · outbound

This paper cites Visual genome: Connecting language and vision using crowdsourced dense image annotations.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Visual genome: Connecting language and vision using crowdsourced dense image annotations

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.197698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.197698Z digest=sha256:0fcfc3f59bfff65765b69916095654a6d52fb0cd7093b61084c373e39810f9ad

Observation 483cf381-cdaa-4c04-a336-644dc5bcace0 · outbound

This paper cites Lisa: Reasoning segmenta- tion via large language model.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Lisa: Reasoning segmenta- tion via large language model

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.202060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.202060Z digest=sha256:f063c9ac6b5e1b6c71c474aa9b09b3a75464ea7fee16c2f4fea95dadd4da9cf4

Observation 9d4f8ff6-b2c6-4b46-b65d-83a55ae01d0b · outbound

This paper cites Detecting mo- ments and highlights in videos via natural language queries.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Detecting mo- ments and highlights in videos via natural language queries

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.206802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.206802Z digest=sha256:d1f8500968a65e9eeb2ad3139aecad272f054b28cb056b0f1e228efb150f2a36

Observation 3e441280-5a69-4a81-9093-da47acfcb776 · outbound

This paper cites SiamRPN++: Evolution of siamese visual tracking with very deep networks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment SiamRPN++: Evolution of siamese visual tracking with very deep networks

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.210658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.210658Z digest=sha256:c34d98d17d6fa0fef1abae60b96ca1770216b52310801525789884e7e740e5ac

Observation aa491ba9-b8ea-41c7-ab2e-59cbc3a38dcf · outbound

This paper cites Seed-bench: Bench- marking multimodal large language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Seed-bench: Bench- marking multimodal large language models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.214870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.214870Z digest=sha256:c0669518fa581b9a9cc54c9bb4029ea9d5197f9ca36d1f46b203f7b0139c1838

Observation f8bebfc0-b866-4763-aef4-58a647a6b53c · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment LLaVA-OneVision: Easy Visual Task Transfer

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.224469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.224469Z digest=sha256:4325995f25e27b6235e2ee21d09a2bd9ebb972ad41e844e5483802a6f66709f0

Observation e0323e11-6fcc-49e0-be01-07331a41f31d · outbound

This paper cites LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.229444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.229444Z digest=sha256:04d16e8bbc722a5ec1f316c5fb6f5cadf4f2a4b014ce74097a87a8682527b3fd

Observation b2b8dbfe-24e3-49e3-b60b-099c9887404e · outbound

This paper cites Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.234149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.234149Z digest=sha256:770b30270744444f4e9a307d11c1d7ba3be7205478100afe04e1e197480a3ea7

Observation a1dfefc3-b266-4371-bdd5-809b4224b1cc · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.238446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.238446Z digest=sha256:c2a6754b6b74c5e59ee357cfa2df222f43236430f0f9f43c221fda3aa7faa6fd

Observation bc44888b-8097-4936-ade0-db1a18d98b24 · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VideoChat: Chat-Centric Video Understanding

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.242711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.242711Z digest=sha256:03ba7fd5aacb279af258ae82e05f751a7247ca277788c726fec96362fa21aaa6

Observation fad59bd5-0922-4de9-a41e-8df0a5f489eb · outbound

This paper cites Unmasked teacher: Towards training-efficient video foundation models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Unmasked teacher: Towards training-efficient video foundation models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.247559Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.247559Z digest=sha256:96a0c492184e49e8d91cd8b5ffaaa98ef19e920f059df944695a5f69e9adf048

Observation bdc73eca-2634-4f3e-aa64-e621c3e803e8 · outbound

This paper cites Mvbench: A comprehensive multi-modal video under- standing benchmark.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Mvbench: A comprehensive multi-modal video under- standing benchmark

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.252019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.252019Z digest=sha256:7d050183e8a34220c90d748454b71d6ed1bb02ad0d74bc650a5352b398edb989

Observation c13ec71b-bf5f-49dd-9338-dff9dac4361f · outbound

This paper cites Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.256747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.256747Z digest=sha256:c35534c153505ca08723bc65db39b4c718e0ca6f311a9ba65b0f3d3508f864cb

Observation 9fcd10b2-ebe7-4196-aa91-09b95183cdb2 · outbound

This paper cites Univtg: Towards unified video- language temporal grounding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Univtg: Towards unified video- language temporal grounding

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.262395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.262395Z digest=sha256:a008c90c051520b5be61917002ff5e86e62bc6cddb22fce7d2df9591181af00f

Observation c7984272-a9f4-4441-b274-3554065941cf · outbound

This paper cites Visual instruction tuning.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Visual instruction tuning

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.266822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.266822Z digest=sha256:2487074191dc21c1b2b003c07c99092d69ad2ed726ed75ce23dc4b91c43b697a

Observation 09c50c66-4d0c-4c60-b7f3-235b2c9d26a9 · outbound

This paper cites St-llm: Large language models are effective temporal learners.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment St-llm: Large language models are effective temporal learners

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.271112Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.271112Z digest=sha256:39fc83e0275f49ab2a162040c4aa2e72add96745d74a648d5ef04e6c97c24b34

Observation 34c63680-e0c1-4889-8d82-48ce724812de · outbound

This paper cites Grounding dino: Marrying dino with grounded pre-training for open-set object detection.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Grounding dino: Marrying dino with grounded pre-training for open-set object detection

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.275158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.275158Z digest=sha256:d30d7b39999031f10a65238f158cb49181b7adbfba39da96eaf972c30df5d7a6

Observation d809c351-6fd8-452c-a66d-568c620d301d · outbound

This paper cites Decoupled Weight Decay Regularization.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Decoupled Weight Decay Regularization

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.278739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.278739Z digest=sha256:8077cb6b1e788c5ec07fcff64de3dcfa4612d6aa3a9faafe1d2ed8d071532d2c

Observation 3defb2b0-6e33-438f-9072-c5d2d5a88ec6 · outbound

This paper cites Unified-io: A uni- fied model for vision, language, and multi-modal tasks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Unified-io: A uni- fied model for vision, language, and multi-modal tasks

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.283388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.283388Z digest=sha256:c33ef2fbfb96a9188002039d50b387a6e3170a38a158c42a98e68859a857b778

Observation c1b178b1-1e35-4331-b275-62fea2903a2d · outbound

This paper cites VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.288900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.288900Z digest=sha256:a550f2f11e998a20f4b9352be0928977589da1593f14edc92eae9307ef65d456

Observation 8c743a22-0b1a-42a3-9780-6b6493ba03e4 · outbound

This paper cites Video-chatgpt: Towards detailed video understanding via large vision and language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Video-chatgpt: Towards detailed video understanding via large vision and language models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.293816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.293816Z digest=sha256:95aa1bf1475cc86aebf9d5e56507bae2004ddcaaec9a9332f5260828fcfeb050

Observation 4a7162bd-a6bb-495a-b577-6d8d03ffcced · outbound

This paper cites Generation and comprehension of unambiguous object descriptions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Generation and comprehension of unambiguous object descriptions

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.298300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.298300Z digest=sha256:fa7748e22307982c69a84c5d737a53820d5ebec318582337857a1cc98967db64

Observation 1a20f7b7-3880-4f7d-9299-d3d699dc12bf · outbound

This paper cites MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.303561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.303561Z digest=sha256:8635d091c0b40826d7d8645a3bcaf4e60d9497077921c5ea3b0c94a1359caab1

Observation 40e62f33-85da-4f3a-bd82-dc428f754b52 · outbound

This paper cites Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.308118Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.308118Z digest=sha256:1918ee27de9adacf4347088429f20ce066261ef4da07de7602afd61bc138d99b

Observation 5b331ab6-7166-4a09-9665-0190eca0c328 · outbound

This paper cites Query-dependent video representa- tion for moment retrieval and highlight detection.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Query-dependent video representa- tion for moment retrieval and highlight detection

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.312789Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.312789Z digest=sha256:373ac00bdb07eb474e820fa7703088abd9f745f3ecfb0e193d0666860ce39402

Observation 9968bae1-ca09-491b-952f-6d6f168c4089 · outbound

This paper cites Queryd: A video dataset with high-quality text and audio narrations.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Queryd: A video dataset with high-quality text and audio narrations

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.317196Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.317196Z digest=sha256:79c9339691631279965b37284e72abd015a50a249671d35be355b1d37ade1137

Observation 8d9cff8a-e079-4b2f-93f3-ed73883400ba · outbound

This paper cites Perception test: A diagnostic benchmark for multimodal video models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Perception test: A diagnostic benchmark for multimodal video models

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.322288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.322288Z digest=sha256:d8210e3267c967d28f72abbe0e75da4db05f84d46556bce26773986d2d475baa

Observation 39a8fa6e-9ea8-497c-b21c-8e2b8f6bf09d · outbound

This paper cites Streaming Long Video Understanding with Large Language Models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Streaming Long Video Understanding with Large Language Models

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.326508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.326508Z digest=sha256:6b5eb7d3621aded0ed0e7d2ef5592d031443835ec77573e81061934ebd8e6d3e

Observation e2d36a86-b50a-4fac-938f-4371443238f7 · outbound

This paper cites Chatvtg: Video temporal grounding via chat with video dialogue large language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Chatvtg: Video temporal grounding via chat with video dialogue large language models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.332811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.332811Z digest=sha256:b348a7e94a6fad04ad1b63f5772de4bacf5cbc521f5582fa74bd8c3ceea2f74c

Observation c1701f76-a5c1-4331-9487-caf296513d44 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Direct preference optimization: Your language model is secretly a reward model

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.336988Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.336988Z digest=sha256:80b520c28109c90ece27acabd88d7df70a392c4c08f64b408367ccb7f2106095

Observation 59c7af4f-bccb-4e68-978c-8817061a0711 · outbound

This paper cites Deepspeed: System optimizations enable training deep learning models with over 100 billion param- eters.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Deepspeed: System optimizations enable training deep learning models with over 100 billion param- eters

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.341269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.341269Z digest=sha256:1ce46035941a97523578b59eb94e04ddd705d6a02529f6832af5a5f400641ace

Observation 6ac49e2a-8bd7-413c-bd64-1c43dcf8b128 · outbound

This paper cites SAM 2: Segment Anything in Images and Videos.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment SAM 2: Segment Anything in Images and Videos

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.345742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.345742Z digest=sha256:fe07ff45f5f2e9478b0a806b24fa77f25dc16de002921bacf9d4db0b9483decb

Observation b08a3b39-9ca2-4c34-80ee-5658aa397b2a · outbound

This paper cites Ground- ing action descriptions in videos.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Ground- ing action descriptions in videos

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.351149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.351149Z digest=sha256:f25f70d9461dae75a151b8e9b87578c678f31da5649ca2cd0c84940f8a0751f3

Observation a3e98c36-3502-47d6-b542-48226d44bbbe · outbound

This paper cites TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.355668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.355668Z digest=sha256:ba6a3b76c44b055cb650eb249342a640cb9d27c9a523d23a1e4fdb82ccfa3301

Observation 17dbad4b-7936-4613-9729-c3849276a502 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Proximal Policy Optimization Algorithms

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.360128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.360128Z digest=sha256:409bff015cb2e1529378b1237b7c0bede8b40c566849b01bf21990f08e185b78

Observation 51259c39-5220-4606-bc20-07784baa90fb · outbound

This paper cites Urvos: Unified referring video object segmentation network with a large-scale benchmark.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Urvos: Unified referring video object segmentation network with a large-scale benchmark

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.364501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.364501Z digest=sha256:5d5618f1adb081eadef99d8fc063ab180d79a78f003c009a7791ba47bfc9a019

Observation f9bbda58-9867-4d77-ad12-18f39f3505bf · outbound

This paper cites INTERN: A New Learning Paradigm Towards General Vision.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment INTERN: A New Learning Paradigm Towards General Vision

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.369157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.369157Z digest=sha256:6747cd9bd2531793c948471db40a6b2cf1d7e13c80c4733491b5075edf7f3ab3

Observation 1644b85d-d3fe-450f-84e7-f25adc439ad4 · outbound

This paper cites Aligning Large Multimodal Models with Factually Augmented RLHF.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Aligning Large Multimodal Models with Factually Augmented RLHF

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.373619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.373619Z digest=sha256:29efb9479f40b5893c7df9ded9ca7bb3767fc337e06b8076d2cc217a821f1c78

Observation 34da1976-ea7c-4349-b3f2-78c89cec254b · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.378201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.378201Z digest=sha256:0150dc30414fb7063eb2016dc7ddd56bcedead641335ad062af82705f683f50b

Observation 2fbe6ac4-4c09-4a10-a61d-1f7bc63deb60 · outbound

This paper cites Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.382579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.382579Z digest=sha256:69cdff0a32dfa70a6f2944c8a62443868bc0879cc8646724852981fbfd9dc718

Observation d3958667-486e-4e66-b164-d7e9e50dd5bd · outbound

This paper cites Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.387207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.387207Z digest=sha256:aa33c3dc2c884c9ae94d234117014b63a1984bbea430a25011f8dec19b8c2c78

Observation 2112d1ed-6146-47f7-92ea-6bdcb1547a2c · outbound

This paper cites Temporal segment networks: Towards good practices for deep action recogni- tion.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Temporal segment networks: Towards good practices for deep action recogni- tion

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.391944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.391944Z digest=sha256:7c0037dc9d862a7f63cb9f1a9d5ed8fbd6c051f2a1e5c6c39bbd821279175037

Observation ec9bd1bd-44ba-4c59-a207-49c8d7f51987 · outbound

This paper cites Videomae v2: Scaling video masked autoencoders with dual masking.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Videomae v2: Scaling video masked autoencoders with dual masking

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.396143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.396143Z digest=sha256:5dca70c24beddfe1d9945b96293bbf6765752300cf9eadffdc45ac850f670034

Observation 950ebfcc-fe51-4d1e-b994-3a6ba25d58ec · outbound

This paper cites Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.400268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.400268Z digest=sha256:c3fb658e925ba380a2ec6c7e2ccf864867f92af0ec3656e44eb653cd5c53c4ab

Observation 74d4d335-58f0-4119-9d72-0528800240be · outbound

This paper cites Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.404321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.404321Z digest=sha256:fef9132fe6dc834d6f3cc98d6e78ba6edba1b3a660c0e964c5effe35e01955f8

Observation e144cf75-68db-4d8c-8b1f-f2b7b0840a06 · outbound

This paper cites Visionllm: Large language model is also an open-ended decoder for vision-centric tasks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Visionllm: Large language model is also an open-ended decoder for vision-centric tasks

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.408253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.408253Z digest=sha256:2fcc0aea83259873db6095a94f8f00cec6b47fa0bcbd90c73570c6a74d66c9d9

Observation 5a475ba5-0bba-44a8-8f13-ad99d42f6da7 · outbound

This paper cites The All-Seeing Project V2: Towards General Relation Comprehension of the Open World.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment The All-Seeing Project V2: Towards General Relation Comprehension of the Open World

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.411857Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.411857Z digest=sha256:a51d96e7965588b77a2871e616d205e3f07bb57396c3a269fd6c626597a6764a

Observation 7183b465-9ded-40cb-ac24-a0a124b62acc · outbound

This paper cites Seggpt: Towards seg- menting everything in context.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Seggpt: Towards seg- menting everything in context

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.415522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.415522Z digest=sha256:6bdd47e9ca70dccb0c5176a595b488a8b914e4eb77bb97253fd8b649f1aee9f8

Observation b9879015-eb3b-4f0e-92e7-a6d1a3500f8e · outbound

This paper cites Internvideo2: Scaling video foundation models for multimodal video understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Internvideo2: Scaling video foundation models for multimodal video understanding

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.420144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.420144Z digest=sha256:965ff5271e5aae06be4b0f2bd1dd079a8af3b912c13f9d71f1169702b3669d64

Observation d1d2b970-e28e-4342-86a8-428ab4a2ecd2 · outbound

This paper cites HawkEye: Training Video-Text LLMs for Grounding Text in Videos.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment HawkEye: Training Video-Text LLMs for Grounding Text in Videos

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.424055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.424055Z digest=sha256:4f8b949f23c09366bcde9af7a9488720ddae4c655b69defd673e2f955b3f3421

Observation f5828baf-26d0-4374-96a8-f28430e0b0e0 · outbound

This paper cites Onlinerefer: A simple online baseline for referring video object segmentation.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Onlinerefer: A simple online baseline for referring video object segmentation

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.428352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.428352Z digest=sha256:2b24dae4b8dfc390704937743abaab19a3475ed250d23f1d78a831d43820b5fb

Observation 0fa3f08d-b539-4dd9-bfe4-2fd269787767 · outbound

This paper cites Language as queries for referring video object seg- mentation.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Language as queries for referring video object seg- mentation

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.432309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.432309Z digest=sha256:626dd363c0a2f105ccef3368556a9f0ff36206c5567642595db2891737a68841

Observation 88ea1575-cc00-4422-b235-a431703f2c99 · outbound

This paper cites VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.436431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.436431Z digest=sha256:401d84dcb01a8a0565c3117f047f1e8c922bbc95ce5a6b7885c0c88c675a70d5

Observation 4ad712a8-de74-4069-91b1-a9578a193cfe · outbound

This paper cites Can i trust your answer? visually grounded video question answering.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Can i trust your answer? visually grounded video question answering

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.440788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.440788Z digest=sha256:2a8e6256b9ab1e186851b3148094cd86350f9115797df6a76be238925f8ad7a6

Observation 3ddf5ce7-84dc-42d3-8609-cc57bdfe64fc · outbound

This paper cites Videoclip: Contrastive pre- training for zero-shot video-text understanding.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Videoclip: Contrastive pre- training for zero-shot video-text understanding

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.445447Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.445447Z digest=sha256:347d5931ebd54bb9e348166df6dee2cd4bec57020b897bb29069ea825b612c90

Observation b0326a83-5692-4b07-a186-e7fe06aba81e · outbound

This paper cites PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.450250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.450250Z digest=sha256:bdd1a34fb1bf8a590ce3cb6fa7d61bec416ad1ec0c6088763ecbb889a05a99f7

Observation 642dc38d-2816-4dc2-b509-2e43aa7a8eca · outbound

This paper cites Siamfc++: Towards robust and accurate visual tracking with target estimation guidelines.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Siamfc++: Towards robust and accurate visual tracking with target estimation guidelines

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.455596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.455596Z digest=sha256:1d4ba9b3b4b2d840e3a0d7f2510e5d9694edd3e55f0133e33615d4f029f75e39

Observation 33e06ae5-572b-4d9c-9a21-50afbc3fc684 · outbound

This paper cites VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.459953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.459953Z digest=sha256:24361f1befe3aeb3d8f35bac0a842935134c83e477b00cc34f890ac41127786e

Observation 52dcc8d0-e514-4265-abb9-3f22a5911a0d · outbound

This paper cites Zero-shot video question answering via frozen bidirectional language models.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Zero-shot video question answering via frozen bidirectional language models

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.464454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.464454Z digest=sha256:c9a55ddc42f5fa046ac69753364fce383dae4f31d548e29fcbbcfe1f60b79fed

Observation bb85984f-c062-49d6-aaa2-f2dfe3d3d98d · outbound

This paper cites mplug-owl: Modularization empowers large lan- guage models with multimodality, 2023.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment mplug-owl: Modularization empowers large lan- guage models with multimodality, 2023

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.468728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.468728Z digest=sha256:1cc31ca3882074492f30874e7afa5d2c84d46c0f7e8488a198d1dff00f074564

Observation 13197f99-7de3-49ea-8b23-66128b57d23b · outbound

This paper cites Merlin: Empowering multimodal llms with foresight minds.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Merlin: Empowering multimodal llms with foresight minds

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.473590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.473590Z digest=sha256:4fe2b8803396b30af0db2db6c897715e09ba1162bbfcf778c4987aa001ea91a8

Observation c9399eb5-9bae-4a8a-b799-c04f20dd3c4f · outbound

This paper cites Modeling context in referring expres- sions.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Modeling context in referring expres- sions

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.478410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.478410Z digest=sha256:6eb3a9d68955ff6841bb2337aa2de2e656fc71270205f296ca488017f277ea9a

Observation 8789c826-b9f5-461e-b2cf-73d5383661ee · outbound

This paper cites Mattnet: Modular at- tention network for referring expression comprehension.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Mattnet: Modular at- tention network for referring expression comprehension

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.482453Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.482453Z digest=sha256:02fa818792ddb955fc61d2db6e3eedaf4106b6cb8e7ebb5cf482cbfd6a256d56

Observation bf830b6e-aec6-42a2-af31-67bb9de7d17f · outbound

This paper cites Self-chained image-language model for video localization and question answering.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Self-chained image-language model for video localization and question answering

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-11T00:47:12.486338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:47:12.486338Z digest=sha256:f16c2efce5c7c81df50bfbcda2ea11ad7c678e06b80cabbe309c1c5cdf048de7

Observation f6f89742-adc7-4844-b86d-f59213dfa980 · outbound

This paper cites Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback.

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback

Reference 101

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:47:14.010847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-11T00:47:12.490079Z digest=sha256:24918d36ba864f9a3de6681ebe9784153e50b2adb82cb9049f00d79fff17e292

Pith citing papers

Observation d9d4332a-5f1e-483f-a493-4b5634d2952e · inbound

InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling cites this paper.

InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-17T02:52:20.806469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-17T02:52:20.643070Z digest=sha256:2bcbcbcf87443dfb8f03a8777d9856dabf548d6126977419fb118dce1bae2d0d

Observation 38640935-a25c-466a-b623-b70ebbdb310d · inbound

VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning cites this paper.

VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-15T20:56:07.724355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-15T20:56:07.247122Z digest=sha256:3461e62b36616323daf6d5e3f86482d65420be28b26eca931ad7e5e37147d989

Observation 67b175ad-b4c1-464b-a995-9d3420cc360a · inbound

Learning Streaming Video Representation via Multitask Training cites this paper.

Learning Streaming Video Representation via Multitask Training Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

Reference 112

Resolution
unresolved
no resolver link, observed 2026-08-16T05:42:52.030381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T05:42:52.030381Z digest=sha256:bf9e2ebe674f2ccbd01f33edbfe22df76ec1c2b51006a1935d8656feee3033d3

Observation 14bcbbf9-5db4-4c97-b06d-1947d947e93e · inbound

MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering cites this paper.

MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T19:00:53.763494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:00:53.763494Z digest=sha256:4a671eca8ea5bff89099e4792f6b1a605a2b2210ad16b3327d73af67490d2680

Observation a6be8cda-4407-4ef7-acbc-29899c8ec6c1 · inbound

A Survey on Video Temporal Grounding with Multimodal Large Language Model cites this paper.

A Survey on Video Temporal Grounding with Multimodal Large Language Model Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

Reference 122

Resolution
unresolved
no resolver link, observed 2026-08-05T23:32:18.017165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:32:18.017165Z digest=sha256:2af3f65f79c2300493ab148b31e836cf30b3d01cdf472c4caee9fa6b7dff307c