Pith. sign in

Paper Citation Record · LEDGER

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

As of 23 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 5 inbound Pith citation observations for arXiv:2505.20777.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.20777 v1

Coverage vector

measured 52 of 52 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:51:32.247216Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-01T18:40:14.013017Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T22:06:16.638707Z

Reference resolution

52 of 52 outbound references displayed

  • verified exact1
  • verified fuzzy10
  • unresolved41
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f73ea394-c64f-4ec3-960f-677426875167 · outbound

This paper cites Vision-language models for vision tasks: A survey, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Vision-language models for vision tasks: A survey, 2024

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.367337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.367337Z digest=sha256:48db926b2577287a8915706857f3bde981b3d28fe21859799db4d9d22c37f822

Observation 486103d8-e4af-4e90-b429-11ed3f5d70a7 · outbound

This paper cites Show, attend and tell: Neural image caption generation with visual attention, 2016.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Show, attend and tell: Neural image caption generation with visual attention, 2016

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:35.944372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:26.444660Z digest=sha256:7b6ee055f087647593f75dcf0722d2cd9ec0925685c9ce53b2546cdc06e67143

Observation 031a92e9-f738-4004-83a3-6d55f0356d40 · outbound

This paper cites Lawrence Zitnick, Dhruv Batra, and Devi Parikh.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Lawrence Zitnick, Dhruv Batra, and Devi Parikh

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.560212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.560212Z digest=sha256:438475acb6d65238b4d4f8bb5b76ab60d3405a33d78e66900296a648aa506c17

Observation c85527a0-cded-4630-92f7-14800379efb6 · outbound

This paper cites GPT-4 Technical Report.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs GPT-4 Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.647187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.647187Z digest=sha256:5783519d4672bf8d211a1de645709bf9478873ff8656dc857336b8c71ee5f3d0

Observation 4658fd14-fb31-4d9e-aa57-4fc65c261901 · outbound

This paper cites Qwen2.5-VL Technical Report.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Qwen2.5-VL Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.746276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.746276Z digest=sha256:6207c11af0ef9a5ddcf224df10e79ffc0d2d26f8dbe2431dd09d65f6a829dab2

Observation 577d6d7b-3301-454a-878e-baa80e0fd88d · outbound

This paper cites Deepseek- vl: Towards real-world vision-language understanding, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Deepseek- vl: Towards real-world vision-language understanding, 2024

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.835457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.835457Z digest=sha256:4a485a5903addc89a61501eac0adc5e9868f2a32ed6b7e064ff37b2441a71c5e

Observation 7d5b3669-97ba-431a-81f4-3ecab4b991af · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.960508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.960508Z digest=sha256:c7f277c57e49689cca2bcde616b246a76625bbc017f72921925f3c1e70b9cf58

Observation e0986aec-edef-4e42-b902-ccd81cca6c2c · outbound

This paper cites 3D-GPT: Procedural 3D Modeling with Large Language Models.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs 3D-GPT: Procedural 3D Modeling with Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.058830Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.058830Z digest=sha256:0066d7cec2a51f97037934ab42c9dfdb068f477105f0494b19c85ef456235737

Observation 1a3d4937-1f3a-4212-bd29-b32096b4c599 · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.175131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.175131Z digest=sha256:525e050668e08efa9dd9e7ad4fb16a68728b516a7a274e2715958a2132c50b1f

Observation d678dc10-7f12-4c08-bc93-481545c78a48 · outbound

This paper cites Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.290047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.290047Z digest=sha256:f589e8a6cc78ad4eafaa8c94c243d4aefff1b5445549b33c3e1fa2cb70f8b6f9

Observation 3113d389-c779-4717-8fdd-cb8e2be1fa06 · outbound

This paper cites Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.390953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.390953Z digest=sha256:a06e6104a09ff3d341cd51c624fe8bdbc807205a6341fdb31bfd88b79bf77a60

Observation aeca7fdd-8e26-4d22-9f5f-eec800e2f97d · outbound

This paper cites Detecting and mitigating hallucination in large vision language models via fine-grained ai feedback.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Detecting and mitigating hallucination in large vision language models via fine-grained ai feedback

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.556339Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.556339Z digest=sha256:629e57329ac624853fb0982d39297fafc88bb5ea4691f83801b100344e9d2cf6

Observation 572ac910-67de-441d-8e6d-b4100e1d0a6d · outbound

This paper cites Rlthf: Targeted human feedback for llm alignment, 2025.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Rlthf: Targeted human feedback for llm alignment, 2025

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:35.615617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:27.707172Z digest=sha256:68dec2da61b5e5f193f6ec1a3b23925a3b0040312a50b65ff652fcffb89a3fa3

Observation c44f92de-bc07-45fa-9df4-1788652c6064 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.829573Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.829573Z digest=sha256:94d52498b9f6a1665700b75f05280eba1b55372ed70f5206963e40453a043e3a

Observation 0b8f7dad-9b9a-4e45-a218-35b8531d00d2 · outbound

This paper cites Grpo-lead: A difficulty-aware reinforcement learning approach for concise mathematical reasoning in language models, 2025.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Grpo-lead: A difficulty-aware reinforcement learning approach for concise mathematical reasoning in language models, 2025

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.965548Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.965548Z digest=sha256:d4d1f8803436b33537a1a1df7335b54f18bc8fc98ab0d3415ef5cb029376b2c4

Observation 8011e1f4-495e-4e71-a275-5efd6e6df286 · outbound

This paper cites SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.087581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.087581Z digest=sha256:c7e116e6482be73d3fcea5ebd91de4e69473361a56adfcfff8872ed97de9d7b8

Observation bfa8e2db-ff1b-47d4-84d4-4b85ce4f5afe · outbound

This paper cites Towards visual grounding: A survey, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Towards visual grounding: A survey, 2024

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.230068Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.230068Z digest=sha256:33ec42110f0d73bacd5ee1729759d64b68ccd51764eb2d3efa96d1762a88a3ba

Observation 64510dd2-04ee-4eac-9bc6-a3cffb2de1a9 · outbound

This paper cites VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.342768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.342768Z digest=sha256:919c957ea31de24e1616a7c07c232e319175dead71d6be069dd06c0a83d8ed32

Observation ed228e8c-f02a-443c-a460-08c597959750 · outbound

This paper cites Learning transferable visual models from natural language supervision.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Learning transferable visual models from natural language supervision

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.458593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.458593Z digest=sha256:e66a97086458246fbcfcd857ac4cc2154eae7997d691f50e94b285ab47bf88c9

Observation 3a655876-6a4f-45e3-9a8d-dfafe75eea61 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.597319Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.597319Z digest=sha256:56852e7cb11ce8863a1ab82917e0bba47111d7039ee6fc96a8802adce69f041b

Observation da158765-d595-4c5f-9932-f501511c471a · outbound

This paper cites Introducing openai o1-preview.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Introducing openai o1-preview

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:35.278756Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:28.700760Z digest=sha256:1efc22ea768cf037772a65d6f5acc3deca7f4cca435d927009d761b3b95fb995

Observation 560d7927-4d9c-46b4-a9ea-3c2666b317b7 · outbound

This paper cites R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.831793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.831793Z digest=sha256:5ab6e87424b913ab74f5bb21ce05ba5665d16d5bf13a4e88691e157a40f3ece2

Observation 47b2dc5f-db0e-4584-a974-4e11b75fa826 · outbound

This paper cites R1-v: Reinforcing super generalization ability in vision-language models with less than $3.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs R1-v: Reinforcing super generalization ability in vision-language models with less than $3

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:34.947632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:28.947669Z digest=sha256:06526458c6e91ce0edc2eb560aef27f483dd49802928ec7efd5fac4380eea06e

Observation 8ee8b4e6-4619-457f-98b9-377daf783e89 · outbound

This paper cites Visual-RFT: Visual Reinforcement Fine-Tuning.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Visual-RFT: Visual Reinforcement Fine-Tuning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.090072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.090072Z digest=sha256:e57918029e1369be1f47ac78423b93bf9030a7de8112baead984a0a6899cc02c

Observation 79ac7303-9e85-429e-b7ef-91fbb3d54566 · outbound

This paper cites R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.190305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.190305Z digest=sha256:ec7618e76fd15872702b7032b90c07d91f1ba5aabbafa99b46b36b7f09101bf8

Observation e247608d-0ad2-45c4-a8a6-31f7482a5684 · outbound

This paper cites Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning, 2025.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning, 2025

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.307567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.307567Z digest=sha256:4d72531fa1e6bc458b7ac87d81ec53bdd9046d103f068d8c84a2410722059c8c

Observation 2ddce2ba-3ff0-4111-84da-ff185ab93f68 · outbound

This paper cites Proximal Policy Optimization Algorithms.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Proximal Policy Optimization Algorithms

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.453912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.453912Z digest=sha256:8dea32a3948fe7ac6aedc13e5ea2bb88935a82bfe7f4d63170da4e64ed144cd5

Observation b848829b-590c-4f91-a709-31e4c80891ab · outbound

This paper cites Referring expression comprehension: A survey of methods and datasets.IEEE Transactions on Multimedia, 23:4426–4440, 2020.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Referring expression comprehension: A survey of methods and datasets.IEEE Transactions on Multimedia, 23:4426–4440, 2020

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.595605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.595605Z digest=sha256:30f6ab3a5d8f47b135a292e775afdb00d1f8da57c26c2b9ffd2dd8ad664de19c

Observation efc784ed-8649-4591-8297-215f26b94ec2 · outbound

This paper cites GREC: Generalized Referring Expression Comprehension.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs GREC: Generalized Referring Expression Comprehension

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.730715Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.730715Z digest=sha256:f385bf16f62b37b27baad9ddf2b1d9bb59c181097c440cfa1303dd60a7845da7

Observation 3f1f2259-9bc5-412c-86b1-6bbafb1b0725 · outbound

This paper cites Vqa: Visual question answering.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Vqa: Visual question answering

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.866232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.866232Z digest=sha256:5d7ae837d288a066d115c814de23997983f7cdcd68c0ed1442074557a89e1604

Observation 93c76e6d-86e7-4cac-8e21-0a335cd68431 · outbound

This paper cites Visual question answering using deep learning: A survey and performance analysis.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Visual question answering using deep learning: A survey and performance analysis

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:34.683229Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:29.990414Z digest=sha256:4f93d24e47d4974d0051d894b5b8e6cb3c323c0249f0e7d5449ef8e1600c60a9

Observation d1215f91-3097-4af8-a453-d810d496f0a3 · outbound

This paper cites Generation and comprehension of unambiguous object descriptions.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Generation and comprehension of unambiguous object descriptions

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:30.088013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:30.088013Z digest=sha256:92d2d72d02225ead7920041c2ed4f6aa08e9c05eea52f7067bd9968d856f986c

Observation cbd0653d-6b7a-499c-b911-73639dfbb00b · outbound

This paper cites Modeling context in referring expressions.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Modeling context in referring expressions

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:30.226114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:30.226114Z digest=sha256:749a449fb533a0e29387ec21348d3222d51c7235cc751cce94688f527cef1efa

Observation 5b3c60dd-f435-4b9f-afd3-793571be997d · outbound

This paper cites Generating easy-to-understand referring expressions for target identifications.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Generating easy-to-understand referring expressions for target identifications

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:34.379248Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:30.349318Z digest=sha256:f176c2197a0a34de3eed83ccd2070c4acb74d6e7de7dc6b74383b725935c2191

Observation c7e28c85-9174-4f25-9be6-d027b2389de7 · outbound

This paper cites Lisa: Reasoning segmentation via large language model.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Lisa: Reasoning segmentation via large language model

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:30.483232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:30.483232Z digest=sha256:734e83954d5b11fa3111235d161af8061eb43fd79d3241bab7ea1c8ac41f7a85

Observation 83f6a806-eaf5-4f92-b3e0-654cc67cd64e · outbound

This paper cites R1-onevision: A unified benchmark for vision-language reasoning and generation, June.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs R1-onevision: A unified benchmark for vision-language reasoning and generation, June

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:34.126018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:30.607017Z digest=sha256:2bb7be79c06a1b6c1d6ed1a2e683ab56ec21d4ae39018c728e3c174a54e4ea51

Observation fb81a721-d494-473d-9364-7158b7b72664 · outbound

This paper cites Are We on the Right Way for Evaluating Large Vision-Language Models?.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Are We on the Right Way for Evaluating Large Vision-Language Models?

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:30.818162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:30.818162Z digest=sha256:7074766d8b5dd96144a5f7d379ebdcc9231e9ae0aeb5764a983da232040d6695

Observation 8df142c1-5998-48fd-ab18-c34ac98e8928 · outbound

This paper cites A diagram is worth a dozen images.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs A diagram is worth a dozen images

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:30.889047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:30.889047Z digest=sha256:227733fd439728c3b3c924a271078ebb360288dd4eb23d895db64877387704b9

Observation 24dd8fe2-3296-47f5-833e-48517394d014 · outbound

This paper cites Infographicvqa.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Infographicvqa

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:33.599688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:30.974316Z digest=sha256:7a00a2f6dee3b2139f41990f915b10f70e1229fc7d99ea2a3421fcfd5fa9c0de

Observation df1babcd-f7df-45b2-baaf-0b279b825e02 · outbound

This paper cites Towards vqa models that can read.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Towards vqa models that can read

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.032048Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.032048Z digest=sha256:5175278c7244d27d3ae25dbc8abfd8fb4ab6d8a687a438bbe80ac9068a801a62

Observation 513391da-8308-4512-95bd-4deba6eb9cb8 · outbound

This paper cites Docvqa: A dataset for vqa on document images.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Docvqa: A dataset for vqa on document images

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.099093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.099093Z digest=sha256:12bae69f7cb20c59396aa2566e40c93a17017772e6abd6475d5327511cf6626e

Observation 0fba8c8d-445b-475a-b9a0-c406363c3b4b · outbound

This paper cites Measuring multimodal mathematical reasoning with math-vision dataset.Advances in Neural Information Processing Systems, 37:95095–95169, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Measuring multimodal mathematical reasoning with math-vision dataset.Advances in Neural Information Processing Systems, 37:95095–95169, 2024

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.172238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.172238Z digest=sha256:783f3c5385be2ffd91844bbb1b0721a0f95a90d5b304e540b9cd189fe3c3cf23

Observation 21f31f13-f9d6-4de3-aa28-70385197870a · outbound

This paper cites Mmbench: Is your multi-modal model an all-around player?, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Mmbench: Is your multi-modal model an all-around player?, 2024

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.257117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.257117Z digest=sha256:00bf4ce145ef63056c24b0cbae44c0d560ce22511d7311ac7bb74fc79f40a1c2

Observation bfa9161d-c6a9-40fe-813e-5ed6289c45ed · outbound

This paper cites On the hidden mystery of ocr in large multimodal models.arXiv e-prints, pages arXiv–2305, 2023.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs On the hidden mystery of ocr in large multimodal models.arXiv e-prints, pages arXiv–2305, 2023

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:33.327754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:31.358887Z digest=sha256:d7554bfc8243e5a4aa21824492637ead90e88ef8891b262edef40ff0291880c3

Observation 50090ec8-945f-44e5-b00b-819a9d59a361 · outbound

This paper cites Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-08-07T13:51:32.636459Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:31.426677Z digest=sha256:413ff09684f935fafcda8ee8b7af34af9809a51198dfe8b6d951d7a86e47df25

Observation faf6aee4-a806-4df9-9f53-7c57f8dfc09c · outbound

This paper cites Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:33.084907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:31.529362Z digest=sha256:9fdc86d3247f523db02a8a6e4ec12f612318935cc329d2ce39868224584de809

Observation 39b91a93-13e2-4b96-912d-4c0c9081f4f9 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs LLaVA-OneVision: Easy Visual Task Transfer

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.618670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.618670Z digest=sha256:0a7d6666c8657767167f4c643be35e1f0e3a53933ba07ac3ed578feea343c2ce

Observation 0e0354f2-5db9-4aff-9a28-3b87a75ddefa · outbound

This paper cites MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.794999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.794999Z digest=sha256:0035671b391b8e5d2bfcfdd6411a9dce3b6d9ad2248754a154b71ae6dce427a2

Observation 50630a9e-7574-4e54-9ed4-5cffbbbbb7f1 · outbound

This paper cites Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.907314Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.907314Z digest=sha256:d851587aa5941a0fa90268b5b33aa10da0e1217452af4af6ac41f4fd69c22fd3

Observation 019551d9-c68a-4bf7-acad-7e23fd2cbdf4 · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:32.078030Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:32.078030Z digest=sha256:6e808afe4282b7574619755dfacbe1eb5a73a44209163c8b371e626a4d2201c9

Observation 090f1581-b4bf-455a-9812-f9122961da5c · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:32.247216Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:32.247216Z digest=sha256:8aa8f2e58dcfbfdb7104b90b3d584d8f89179a83b931485adc5f9c1e6511e6b6

Observation 930d8c78-b7c0-45b8-8292-63e104186493 · outbound

This paper cites an unresolved cited work.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Unresolved cited work

Reference 2024

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:51:33.835128Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T13:51:30.716013Z digest=sha256:333885a7fa39461716de02f0abee124bc3e514b410cef5f8cd089f86e6845f11

Pith citing papers

Observation 5ae88b79-d5e3-4afc-bf32-456f4cc57230 · inbound

A Survey of Reinforcement Learning for Large Reasoning Models cites this paper.

A Survey of Reinforcement Learning for Large Reasoning Models TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Reference 249

Resolution
verified exact
arxiv_id, observed 2026-05-18T00:02:24.616376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-18T00:02:24.352947Z digest=sha256:5940b4dd522c668c2b1000217af1a56929222d5a93bb3fb5ae77777adaafacaa

Observation e9b9c12a-8212-4ce8-b8bb-139bacd918d8 · inbound

Faithful Mobile GUI Agents with Guided Advantage Estimator cites this paper.

Faithful Mobile GUI Agents with Guided Advantage Estimator TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Reference 9

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T16:41:24.598890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-09T15:17:05.477466Z digest=sha256:920d089f2b2035d999a6f110fb5a553f3f5bafa6b9f91b377dbcb0af8926d612

Observation 643a9df2-e962-47c5-b9b4-fd16fbf27ffa · inbound

Trust Region On-Policy Distillation cites this paper.

Trust Region On-Policy Distillation TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Reference 4

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:56:13.698251Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-06-28T17:38:50.313305Z digest=sha256:cee6b700d04beb4fed5f0922582bcd5363b58c150cb6822b90098aac6400f965

Observation 20f70eeb-b24b-419c-91bd-eea014b96751 · inbound

Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning cites this paper.

Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Reference 39

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T22:06:16.640147Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-06-28T15:45:26.891621Z digest=sha256:8f7449c944ab79e417a8b1de731f0172584febad36a934cb8c83b56525ac8b77

Observation fe678d8d-32ca-48e6-be9a-97308206e2ed · inbound

LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning cites this paper.

LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Reference 2026

Resolution
unresolved
no resolver link, observed 2026-08-01T18:40:14.013017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T18:40:14.013017Z digest=sha256:5062acd0168bef794fd32180354f8940234699b239e2c4207d627b4c4bc0ad0b