Pith. sign in

Paper Citation Record · LEDGER

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models

As of 14 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2502.10250.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.10250 v2

Coverage vector

measured 14 of 14 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T18:51:10.479437Z

measured 14 of 14 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

14 of 14 outbound references displayed

  • verified exact1
  • verified fuzzy2
  • unresolved11
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f54d4585-f05a-4c98-b478-db00235b1ff4 · outbound

This paper cites Mistral 7B.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Mistral 7B

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.396754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.396754Z digest=sha256:fb96e983462cea3cb14100fa1a9facce487f0e71e362cdff2c0465b0d9b542f9

Observation 37a019c0-ccec-4600-a883-838bbd380c5f · outbound

This paper cites AnglE-optimized Text Embeddings.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models AnglE-optimized Text Embeddings

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.422113Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.422113Z digest=sha256:a5794c2d789d87107890485e67b122e7ebe0e9094030fc2684d9af7a3a02a037

Observation cbe8465b-666e-4474-959d-90bd695456de · outbound

This paper cites Prismer: A Vision-Language Model with Multi-Task Experts.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Prismer: A Vision-Language Model with Multi-Task Experts

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.428909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.428909Z digest=sha256:0dcc0aeedcd5c3e53b160feb901e1feaea68c0e46b0b6553ee0cb49db631feb2

Observation b04e03f2-cdb9-478c-abd7-829f9ec0989f · outbound

This paper cites FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-08-07T18:51:10.631920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T18:51:10.437362Z digest=sha256:5f2dbb66326bc1513381b8cddc02544a5f2fba8e3ae3aad3d122697ae4539fa0

Observation 5d72e60f-2d8a-4101-8f88-827bb158a8cc · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Gemma: Open Models Based on Gemini Research and Technology

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.445511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.445511Z digest=sha256:08b33484055342081bbdacfc7532d2bfbf6ff20d196114cfddec31daeac2ee39

Observation 4b7d06a7-4eb2-4aba-9c9f-11f48fbf400a · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.452158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.452158Z digest=sha256:b7539c1285903dfd94462bdffb7014a6536ffcb40b52d17b93f8a647eb8b58b0

Observation b49e3b7c-8e44-478c-97c4-d55bc2c8562b · outbound

This paper cites OpenChat: Advancing Open-source Language Models with Mixed-Quality Data.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models OpenChat: Advancing Open-source Language Models with Mixed-Quality Data

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.458835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.458835Z digest=sha256:66e36fa6b103dc479161b88e93383bdc0c040a77299b46cab26d3a5971174e7a

Observation 7d3b72f3-9ac3-47dc-971f-7913d16d98b5 · outbound

This paper cites Meta-Transformer: A Unified Framework for Multimodal Learning.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Meta-Transformer: A Unified Framework for Multimodal Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.466981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.466981Z digest=sha256:aa3928cbb979b7cd89dda41c6e0c2b0d347a1ea9ea35e1703607e695746b8eb6

Observation 2b7debf4-1f14-4b51-964a-345353c0c1a1 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.473670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.473670Z digest=sha256:c48efe3a390d76ef908b50d03f1dc6a4f486f25e718b59f3ebf8a7d76f20a6da

Observation 4c7a2227-17d8-4acd-839b-273b0c428175 · outbound

This paper cites (a) Distribution of Number of Tokens in the Source Context.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models (a) Distribution of Number of Tokens in the Source Context

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T18:51:10.771807Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T18:51:10.479437Z digest=sha256:9a024573a1512a95fd369ca515f698bfc8324a01b8a4e4487078dde30f017e93

Observation f007f6f7-fc3f-4d62-8d85-6c88dc5bb315 · outbound

This paper cites What matters when building vision-language models?.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models What matters when building vision-language models?

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.414354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.414354Z digest=sha256:7d19f06001c4f2c9e26468eb66a75e5deaaab94c871a98cfb299a95685ffd0fe

Observation f21da683-72c6-467f-b430-15aeeb20059e · outbound

This paper cites ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.381594Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.381594Z digest=sha256:f14bdeabb1abb9a246de8cd003275120863972bfa6c0f515095dddf1341f733b

Observation a1df0bbb-20d8-44a9-8860-606321539e65 · outbound

This paper cites A diagram is worth a dozen images.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models A diagram is worth a dozen images

Reference 2023

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T18:51:10.791389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T18:51:10.404020Z digest=sha256:8ddb100b08ce5635f8241aa6bc5d92a156eb17e831a9f9dfda60eeacb39b4afc

Observation 087f2118-5123-4cfa-a18c-9d377f22aa4b · outbound

This paper cites ShareGPT4V: Improving Large Multi-Modal Models with Better Captions.

VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models ShareGPT4V: Improving Large Multi-Modal Models with Better Captions

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-07T18:51:10.388827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T18:51:10.388827Z digest=sha256:1479ac570c9cf1a679105faac252d0372278fe62ef93b630a453f929dfd1b14f

Pith citing papers

No inbound Pith citation observations are available.