Pith. sign in

Paper Citation Record · LEDGER

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation

As of 14 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2508.01008.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.01008 v1

Coverage vector

measured 62 of 62 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T05:59:15.664441Z

measured 62 of 62 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

62 of 62 outbound references displayed

  • verified exact1
  • verified fuzzy26
  • unresolved35
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 77de1c1f-5091-4938-912a-95ea6d7ab884 · outbound

This paper cites GPT-4 Technical Report.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.447253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.447253Z digest=sha256:105a9efcf1396aa8d375d66633e23dc5a4e1c22c39a77258019e3175e95a3f53

Observation f33e43e0-5ac2-4c4c-8846-dc8f5da62df4 · outbound

This paper cites Multidiffusion: Fusing diffusion paths for controlled image generation, 2023.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Multidiffusion: Fusing diffusion paths for controlled image generation, 2023

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.257836Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.452642Z digest=sha256:0aac4fd3d1b65419169d0d33eaf1e34700e24dc08746673246aa3587bb0756c4

Observation ef88c5b7-ba2f-4644-8814-2ded100596c5 · outbound

This paper cites Coyo-700m: Image-text pair dataset.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Coyo-700m: Image-text pair dataset

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.246018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.456356Z digest=sha256:3289268306ffadf92dce5312068e3e8e4ea6a0d57792ce066d004471f5d687fb

Observation 3e6b6bcd-aa20-4a8d-b405-71ccf698ba34 · outbound

This paper cites InternLM2 Technical Report.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation InternLM2 Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.459932Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.459932Z digest=sha256:1d6692a61304cd1d03cd6b1968485d16160ad83832755f9c73b15c79d21a9294

Observation 7a802e98-d67a-45ec-9e3b-86fedc30fa33 · outbound

This paper cites PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.463874Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.463874Z digest=sha256:172e1fddb9c22f60f95d1ac744d5c593b25dcb03a307ff94c605b4ea87e05983

Observation a57f74c1-180f-4dfc-b297-6559e7eb33a7 · outbound

This paper cites Training-free layout control with cross-attention guidance.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Training-free layout control with cross-attention guidance

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.235144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.468885Z digest=sha256:da4c6a78f4888de8c58a2d8f422305a3985b851bddd31547073352cf7304b5c6

Observation 2701598b-bad2-4951-823f-fd574c4888c2 · outbound

This paper cites How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.472695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.472695Z digest=sha256:d6e2966c3b199ad7699eda3e52d2d24705fefa95deddd553469012ac2940d807

Observation fff1f503-be48-4288-bdd8-83c895fcb5e5 · outbound

This paper cites Yolo-world: Real-time open-vocabulary object detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Yolo-world: Real-time open-vocabulary object detection

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.224851Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.476994Z digest=sha256:94f9727d00cf50ae4bf97dbae27cb440855765891c8173bb938fe54cc8269d28

Observation 7b7cdf4a-83c0-4d7a-b55d-36bb5c69dc3c · outbound

This paper cites Laion pop: 600,000 high-resolution images with detailed descriptions.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Laion pop: 600,000 high-resolution images with detailed descriptions

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.213947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.480962Z digest=sha256:54c2dbb72a78c31003253ffb41d5f88c60070e1e6cf3d22cfce29a6c45f97301

Observation 50095dc7-82b3-46e9-aa8d-9d29971cf9c3 · outbound

This paper cites The Llama 3 Herd of Models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation The Llama 3 Herd of Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.484280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.484280Z digest=sha256:b56f36c672a8666de6b39e6816e65d94582bc2fd6047ed588b9479ff921722e3

Observation 9438a0ce-ce74-4342-978f-57d03d86a504 · outbound

This paper cites Scaling recti- fied flow transformers for high-resolution image synthesis.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Scaling recti- fied flow transformers for high-resolution image synthesis

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.203931Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.488421Z digest=sha256:1c9e335d5b3bfdcc03d164aeebafe331d390939b87cef114937d385e9ed61454

Observation 93e15a82-0e6c-4825-9092-8b0da2d411f8 · outbound

This paper cites Ranni: Taming text-to-image diffu- sion for accurate instruction following.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Ranni: Taming text-to-image diffu- sion for accurate instruction following

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.193135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.491661Z digest=sha256:5c6b1e049b3793f2e5249903bc9d56d1d46c544e0240d342d412e5906062110f

Observation e6dc0a98-1f1e-4dd8-af7e-2e8d392853db · outbound

This paper cites ImageInWords: Unlocking Hyper-Detailed Image Descriptions.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation ImageInWords: Unlocking Hyper-Detailed Image Descriptions

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.495125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.495125Z digest=sha256:ab61a3b06b08610f2ea44c2985110de55614ae81223d27b5df94581b5f0bf118

Observation 5a4d026d-e51f-4c69-a263-2353e07f88ec · outbound

This paper cites ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.498764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.498764Z digest=sha256:13d3c23055796f0c5fd3cd4785de896bf9e13a6c3b98ed736f206eb8ff692e06

Observation ec4ef736-a22c-4e54-80d8-2e2fcf0e8f87 · outbound

This paper cites Generative adversarial networks.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Generative adversarial networks

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.502311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.502311Z digest=sha256:d56dd1845c3c4ed68ffee6059d9fc127267fd417f69bcc7f5e1c5a3438403c52

Observation 9d6ebf94-b546-4cf6-a2f0-048608780046 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.505850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.505850Z digest=sha256:d88368787bb2419ea85f5fb74f580591ed2b17a17cad8898f7f9ac1ca0eb8ff8

Observation a68c98e0-5d59-45c3-bc17-f5f3da9c8edc · outbound

This paper cites LVIS: A dataset for large vocabulary instance segmentation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation LVIS: A dataset for large vocabulary instance segmentation

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.177516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.509041Z digest=sha256:5714a7214d92db31580974fd57d8393c9307d3fde34d994bdcd58813f57f0f53

Observation 2e451c29-f81e-4700-93a1-111666ef7e24 · outbound

This paper cites Retrieval-augmented open-vocabulary object detec- tion.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Retrieval-augmented open-vocabulary object detec- tion

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.167216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.512266Z digest=sha256:0a44755d01726817ffc730ea472e33d82af76b1749b129ffbb7127b19a4d77aa

Observation 56937916-9015-48ff-8881-f86b7f20af56 · outbound

This paper cites Dense text-to-image generation with attention modulation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Dense text-to-image generation with attention modulation

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.157206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.515883Z digest=sha256:bdc8ef4def0864058a4cd548e10714a3bb2f2255afaa235d02b739986577dac6

Observation 9f95e6be-3bc2-4573-a786-0fcd6d081036 · outbound

This paper cites The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.146463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.519045Z digest=sha256:47d1b588d175477860dc1ad51943b4514bb0e47638248dfb318d6d0f1de17776

Observation 464d037d-087b-49e0-9697-6f1fcd9db6f0 · outbound

This paper cites an unresolved cited work.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-06T05:59:16.136002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.522276Z digest=sha256:a9d81072f285ffe1862eb995ce788d8145c0f1450e47fb84a3bcdd7c8ee371e6

Observation d3545566-8d32-40b4-aa70-4d3e0ffd41e4 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.525838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.525838Z digest=sha256:4f0017391feb2c6075bef595994634013df6781b159ed107f2d617a7d834c1bd

Observation e6613a77-2f33-4490-a7b4-c1de1d298e74 · outbound

This paper cites Grounded language-image pre-training.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Grounded language-image pre-training

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.528965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.528965Z digest=sha256:4ff2e836d0a9133348a5b9ddd312abe1b7d7662f7d2bb2fe8036234a9445891d

Observation 65e9596d-df25-4270-9e01-7f6ddaa0cb37 · outbound

This paper cites Autoregressive Image Generation without Vector Quantization.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Autoregressive Image Generation without Vector Quantization

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.532357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.532357Z digest=sha256:84a853215cace9b3319d876bd8b3fb746ee61edb29f6900a5efa64366674771b

Observation 584874c4-b51e-4df2-be1c-ad3ddeaf8f06 · outbound

This paper cites Gligen: Open-set grounded text-to-image generation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Gligen: Open-set grounded text-to-image generation

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.114320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.535880Z digest=sha256:0396ce522bd006e3465e56bc45f425aa27d2be902a5b517e21335ba1df4bc75f

Observation 0a12d2be-2083-4d49-a18a-e96e4b528ae4 · outbound

This paper cites Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.539301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.539301Z digest=sha256:298e2268cdfc94fe0609453c720570893d2d16fd2527da9cb3f50a4815f93e10

Observation 8cef9ff0-f18e-4e6d-8890-d331dedf1ee3 · outbound

This paper cites Lawrence Zitnick.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Lawrence Zitnick

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.104144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.543230Z digest=sha256:7779c8345f22ce738dfbf3f27ec32fb8078e576731d109bc6acb626073f22425

Observation 2972c372-c46f-4923-8e19-7c1e3701b694 · outbound

This paper cites Visual instruction tuning.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Visual instruction tuning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.549776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.549776Z digest=sha256:e4a8c441fad397f151863b3ae5af58a19a0b78bd139ae85e845dcc4c03070bec

Observation 799ba3a8-7c66-47d6-a6db-eaa58a0cc94a · outbound

This paper cites Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.553172Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.553172Z digest=sha256:ffdfcc8b2a376d4fafc71f57f103ff8dbd650c3e14bd850c857b42f36512238d

Observation 798db917-1c23-4eec-abe9-48093b64d801 · outbound

This paper cites Scaling open-vocabulary object detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Scaling open-vocabulary object detection

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.081578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.556574Z digest=sha256:c288f8dbc6b4d99232b7ff01e00ccae1767864425c4d97a39f53e8b53a80a2da

Observation c1b18570-5a77-4e14-9520-86630e70cc47 · outbound

This paper cites DOCCI: Descriptions of Connected and Contrasting Images.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation DOCCI: Descriptions of Connected and Contrasting Images

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.559791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.559791Z digest=sha256:9e56fbef2311f07a422168de6a744696f642dfa4d350c79d7c1ec622be2bf486

Observation 85db6f9c-64c4-4290-9846-e28f3d23432d · outbound

This paper cites Gpt-4v(ision) system card.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Gpt-4v(ision) system card

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.563418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.563418Z digest=sha256:d1eb1380106f532ab2a08aa644420d9653fcfd028e72a371105f292d74a25f32

Observation 98b81ee6-cd5e-49ce-9fd9-270e1e435e55 · outbound

This paper cites Scalable diffusion models with transformers.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Scalable diffusion models with transformers

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.567213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.567213Z digest=sha256:07379391ec9a6bdd43af2d2dda1bc7103bde8f5a81fa8f96bf38315edb57420f

Observation 1837cca4-5c02-4d3f-8e1d-aaf441661d65 · outbound

This paper cites Grounded text-to-image synthesis with attention refocusing.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Grounded text-to-image synthesis with attention refocusing

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.059036Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.570668Z digest=sha256:0b7f3b9dbe69456f70a9c11c373c607e98fefd68c4f662c4e3e2cb42951592f8

Observation 908b97f6-22de-4fb2-afdc-1d8c298085bc · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.573917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.573917Z digest=sha256:8b888f141674e6494c16dc7d58d37d8da7fe75ec3e90c9f042998ae519f07577

Observation 7024cd76-2a0d-4eac-b776-c3a1ede5c2a1 · outbound

This paper cites Stanza: A Python Natural Language Processing Toolkit for Many Human Languages.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Stanza: A Python Natural Language Processing Toolkit for Many Human Languages

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.577307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.577307Z digest=sha256:063e96fff3135679f802a317eb6441c37cc36493344037f7adfc7a6f5b22aa66

Observation afaf257b-0d06-4304-b251-59a663769a15 · outbound

This paper cites Learning transferable visual models from natural language supervi- sion.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Learning transferable visual models from natural language supervi- sion

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.580791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.580791Z digest=sha256:32be87eaa29613bae46fa158314382ffc7a3953e109f6dec4050d577c6e3e3c6

Observation 37938214-507b-4431-8e29-4124034599db · outbound

This paper cites Zero-shot text-to-image generation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Zero-shot text-to-image generation

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.583942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.583942Z digest=sha256:24f18c11d4e3c4bd11ccfedc2f7875409c37b464536e3141a21e5c86d89bd8ff

Observation b8a4b91e-1cbe-4866-8916-23bf32daaf28 · outbound

This paper cites Stable diffusion v1.4 checkpoint.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Stable diffusion v1.4 checkpoint

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.036870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.587044Z digest=sha256:3c61b7ee0914f9a5da8816bebb3f77743bf2a04cb73c2e923c31ea4f25badfa1

Observation e9e2b47d-7207-4603-92cc-7fafccf75e71 · outbound

This paper cites High-resolution image synthesis with latent diffusion models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation High-resolution image synthesis with latent diffusion models

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.026532Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.590226Z digest=sha256:8744e4041a025fa93620f2b3d2133bbf179b5314ac6f8f5f7d6ac9f05704486d

Observation 9d4a3a27-5444-48bf-a621-28759a4034b5 · outbound

This paper cites Laion-aesthetics.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Laion-aesthetics

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.016615Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.593501Z digest=sha256:0f669c682b5a90c68f69f29ac40682e6c8d9f8402e1128d0123c89d51eda1856

Observation f4fa66e1-ddd9-4b72-a679-bfe17225964c · outbound

This paper cites Laion-5b: An open large-scale dataset for training next generation image-text models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Laion-5b: An open large-scale dataset for training next generation image-text models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.596983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.596983Z digest=sha256:a15d6d20ec6efe7493439a7db08eba04289fe4e7d00437c194281998674e566f

Observation 4d9d324e-7f0f-45f4-b0ec-5ecbacbdd76f · outbound

This paper cites Objects365: A large-scale, high-quality dataset for object detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Objects365: A large-scale, high-quality dataset for object detection

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.999193Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.600205Z digest=sha256:6fc8f2813d561f4e364b13f7786e4f2f64d8f674dc7dc5962290a55edc3eabb4

Observation ce87387f-6774-4174-adf5-76bfa3e64914 · outbound

This paper cites From Pixels to Prose: A Large Dataset of Dense Image Captions.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation From Pixels to Prose: A Large Dataset of Dense Image Captions

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.603444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.603444Z digest=sha256:5f9f144ad822dee614243f6da2eaf20a7c77a06bbd3f6132be053b02512e8b00

Observation f2d401de-1157-4434-96b8-28f7dea11fce · outbound

This paper cites Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.607151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.607151Z digest=sha256:0629d99a0a03b97f4b3db39093a75a41e4e8dae305faca33eb2849d8bc22a09f

Observation 38c09d6d-ded2-4e7b-b0ad-e15987f7c9b6 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.610644Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.610644Z digest=sha256:1562bb4586f98b6f70c67047c126c15983c4641c1cf5dcfeab717563945521d9

Observation 9742e30f-4e89-4261-add6-acde697eeb25 · outbound

This paper cites OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.615039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.615039Z digest=sha256:27885481d527c8acf9d089256cd59f37ffe6c5fc28f1844925a1d863615d6be3

Observation 6f6a7ee7-658f-4415-8b68-9d49ee5de36f · outbound

This paper cites V3det: Vast vocabulary visual detection dataset.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation V3det: Vast vocabulary visual detection dataset

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.988752Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.618896Z digest=sha256:7175a26c51fd755dbf87c54bb5240556d671d30ff9fe8d35b3649ea6fc267a95

Observation bfc92a07-7475-461a-83ab-b3b935a2b4bb · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.622106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.622106Z digest=sha256:39958fa2257f965d2ce3aa6444ba04969dad97d4642e3c4a62bf184ff3e7dece

Observation 33c7eb08-1cfd-4758-a1b4-9805c31cf4a4 · outbound

This paper cites CogVLM: Visual Expert for Pretrained Language Models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation CogVLM: Visual Expert for Pretrained Language Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.625916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.625916Z digest=sha256:1d8ff5dee61ab57d9610c6efa091498bf83220a840079421f0315b8862c0ccdd

Observation 96fecee6-52b3-4c19-86cc-d243bece0746 · outbound

This paper cites Instancediffusion: Instance-level control for image generation, 2024.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Instancediffusion: Instance-level control for image generation, 2024

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.978871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.629760Z digest=sha256:56c68dd29616b3779c03964ce216781873706547e22b4b377fd23839529f643d

Observation 20414764-bd0a-4c08-859f-ab2748069f4c · outbound

This paper cites IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.632916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.632916Z digest=sha256:dd2e4354302f17387fc791ba94d5b32c857862d424c99ffec3c72c84ba5ce02f

Observation 47190e2e-cb6f-487f-bcd1-6790ca4821e5 · outbound

This paper cites Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.968577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.636548Z digest=sha256:a198d2ca8f413516459d5875ee6b1fd780b9a09bedf0e1c3a11d1978e468966a

Observation 11966a8c-fafa-4e4c-96d9-89124b9e32c0 · outbound

This paper cites Qwen2 Technical Report.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Qwen2 Technical Report

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.639954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.639954Z digest=sha256:fe8e6a96e5ff71c1eedf32d0eced7d74bbf6e2a311012c52b6d1dce6a4908f28

Observation 022bea05-3bf8-41fd-8391-c2ac7527aef8 · outbound

This paper cites Detclipv3: To- wards versatile generative open-vocabulary object detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Detclipv3: To- wards versatile generative open-vocabulary object detection

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.957022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.643455Z digest=sha256:8551b3178a3b0ccb3ec80098665e71144484432e5f7908fb62324da405e22523

Observation 75f515f5-2b13-4031-b42c-f47808b2960d · outbound

This paper cites Scaling Autoregressive Models for Content-Rich Text-to-Image Generation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Scaling Autoregressive Models for Content-Rich Text-to-Image Generation

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.646747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.646747Z digest=sha256:3db8a956bf6a4408fd08930d88fcb1782589b852a72b813c8fceaaa5ca856eaa

Observation ecd1a846-9a9e-466a-abba-79e3f324ca89 · outbound

This paper cites Glipv2: Unifying localiza- tion and vision-language understanding.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Glipv2: Unifying localiza- tion and vision-language understanding

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.650592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.650592Z digest=sha256:16d5725134432614f2ab1e902c41c7594801161883bde3c53721be73b84d89e6

Observation 7288b7b2-a5be-45c4-afd7-53cb58ab7dde · outbound

This paper cites Recognize anything: A strong image tagging model.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Recognize anything: A strong image tagging model

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.940870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.654082Z digest=sha256:1d57a89858adae7f1f54024b33591f2c2be6620eacf47b834530b1e1d4ef7d3b

Observation 7edd6207-3e5e-40d8-8ede-308d5e5fdb1f · outbound

This paper cites Taming Self-Training for Open-Vocabulary Object Detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Taming Self-Training for Open-Vocabulary Object Detection

Reference 59

Resolution
verified exact
local_arxiv, observed 2026-08-06T05:59:15.700057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.657447Z digest=sha256:0bd4d58ca5a777008b9c33acbd28f403bdb2eff6237f9bb85b2e33f31ddc78d2

Observation a440a126-4c4c-4fcc-bac8-52a6dfdd7968 · outbound

This paper cites Migc++: Advanced multi-instance generation controller for image synthesis, 2024.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Migc++: Advanced multi-instance generation controller for image synthesis, 2024

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.930189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.661112Z digest=sha256:5df589d18ebbd4a9b22d686a41ae4f2ab31267e2e2156eeec37bb385dd38736c

Observation f78d3fea-f5e6-4e64-b566-b5aa1489c56c · outbound

This paper cites Migc: Multi-instance generation controller for text-to-image synthesis, 2024.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Migc: Multi-instance generation controller for text-to-image synthesis, 2024

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.919475Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T05:59:15.664441Z digest=sha256:f14583b6d20a0234126f7485244c0c7c2dc8fc37e65541f4af2ca3a45de8b7b9

Observation 13b8e0a3-f0bb-44e8-b3f7-b80e4667dd9b · outbound

This paper cites an unresolved cited work.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Unresolved cited work

Reference 2014

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.546496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.546496Z digest=sha256:01823279b6aef37ec423550ea17bfe0b3f1158da8777de637c2fac4eb9fe14c4

Pith citing papers

No inbound Pith citation observations are available.