Pith. sign in

Paper Citation Record · LEDGER

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 5 inbound Pith citation observations for arXiv:2505.20777.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.20777 v1

Coverage vector

measured 52 of 52 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:51:32.247216Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-01T18:40:14.013017Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T22:06:16.638707Z

Reference resolution

52 of 52 outbound references displayed

  • verified exact1
  • verified fuzzy10
  • unresolved41
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f73ea394-c64f-4ec3-960f-677426875167 · outbound

This paper cites Vision-language models for vision tasks: A survey, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Vision-language models for vision tasks: A survey, 2024

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.367337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.367337Z digest=sha256:8d29ba088791127d5cbb0f5a6f53625541c2b98c3b61aeffede504f8a991cb4a

Observation 486103d8-e4af-4e90-b429-11ed3f5d70a7 · outbound

This paper cites Show, attend and tell: Neural image caption generation with visual attention, 2016.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Show, attend and tell: Neural image caption generation with visual attention, 2016

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:35.944372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:26.444660Z digest=sha256:bd47f9d0f4517b2c758e476f396b5c8f77c69ab556ba545bbe978ab52eb94549

Observation 031a92e9-f738-4004-83a3-6d55f0356d40 · outbound

This paper cites Lawrence Zitnick, Dhruv Batra, and Devi Parikh.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Lawrence Zitnick, Dhruv Batra, and Devi Parikh

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.560212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.560212Z digest=sha256:eccad025e509f32d73f2e73ce6f9a008b51c61bfd3a3679e424e8129a50ab019

Observation c85527a0-cded-4630-92f7-14800379efb6 · outbound

This paper cites GPT-4 Technical Report.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs GPT-4 Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.647187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.647187Z digest=sha256:e1ccc1ea628187a4a95c0998156527ad15c796702d643bff07ddbfadf91c709a

Observation 4658fd14-fb31-4d9e-aa57-4fc65c261901 · outbound

This paper cites Qwen2.5-VL Technical Report.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Qwen2.5-VL Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.746276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.746276Z digest=sha256:0787e2df44563e4f3b24177363459546ece19ba6862cfd168d89d5f1e6b8a3a8

Observation 577d6d7b-3301-454a-878e-baa80e0fd88d · outbound

This paper cites Deepseek- vl: Towards real-world vision-language understanding, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Deepseek- vl: Towards real-world vision-language understanding, 2024

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.835457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.835457Z digest=sha256:a71c354a77fd97cc3afac267e73d6e4dcd2d7bbea034c4d551a2cacaf96bf6ef

Observation 7d5b3669-97ba-431a-81f4-3ecab4b991af · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:26.960508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:26.960508Z digest=sha256:21fc0a8958d120af0fa761c5f1f837c2694e663608786d320c9cc16d8cbb8b37

Observation e0986aec-edef-4e42-b902-ccd81cca6c2c · outbound

This paper cites 3D-GPT: Procedural 3D Modeling with Large Language Models.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs 3D-GPT: Procedural 3D Modeling with Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.058830Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.058830Z digest=sha256:78f374293bae9aa59603db692fad71935f5fbfb21f6364ce8862f37c2e10f4d3

Observation 1a3d4937-1f3a-4212-bd29-b32096b4c599 · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.175131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.175131Z digest=sha256:a6f2e72ba54486ef1b4f5bbf72f5fb49a961e026a670a0e0ce3d4a914cb96ccc

Observation d678dc10-7f12-4c08-bc93-481545c78a48 · outbound

This paper cites Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.290047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.290047Z digest=sha256:bc0b28bea4c3ffbe3c667163c0e7a14f3de8bc5e67bc6bace3f4d13fd726843b

Observation 3113d389-c779-4717-8fdd-cb8e2be1fa06 · outbound

This paper cites Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.390953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.390953Z digest=sha256:cd84af4b937196d14f5e8461f604702213d47081d4fdeae1a35385de3bf6185d

Observation aeca7fdd-8e26-4d22-9f5f-eec800e2f97d · outbound

This paper cites Detecting and mitigating hallucination in large vision language models via fine-grained ai feedback.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Detecting and mitigating hallucination in large vision language models via fine-grained ai feedback

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.556339Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.556339Z digest=sha256:e8d2ef086323b6989451204b28bbc5dd705ce249f65705b95679576e578bcdea

Observation 572ac910-67de-441d-8e6d-b4100e1d0a6d · outbound

This paper cites Rlthf: Targeted human feedback for llm alignment, 2025.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Rlthf: Targeted human feedback for llm alignment, 2025

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:35.615617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:27.707172Z digest=sha256:acb8798ae8fbabe354d43bc9a34a2c71ffe3fbb95616d26068372a54ed5f0a4e

Observation c44f92de-bc07-45fa-9df4-1788652c6064 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.829573Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.829573Z digest=sha256:fe4b2c53fba30c85de09efb5345cdad3bc8d38c9fbc24045ae1f114376db5250

Observation 0b8f7dad-9b9a-4e45-a218-35b8531d00d2 · outbound

This paper cites Grpo-lead: A difficulty-aware reinforcement learning approach for concise mathematical reasoning in language models, 2025.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Grpo-lead: A difficulty-aware reinforcement learning approach for concise mathematical reasoning in language models, 2025

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:27.965548Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:27.965548Z digest=sha256:7310b443fbadbdb43e8dff19fa73b76f891c27b4422af559cb289ca428adefc2

Observation 8011e1f4-495e-4e71-a275-5efd6e6df286 · outbound

This paper cites SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.087581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.087581Z digest=sha256:2cec55b332828bc741af5ae3cc850b9aa3a6a71b189f7922e3f1b0f448e509a1

Observation bfa8e2db-ff1b-47d4-84d4-4b85ce4f5afe · outbound

This paper cites Towards visual grounding: A survey, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Towards visual grounding: A survey, 2024

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.230068Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.230068Z digest=sha256:000ed7b5877e1f9159430eb72fbabee6691186b93adabe782a202affcd61f96d

Observation 64510dd2-04ee-4eac-9bc6-a3cffb2de1a9 · outbound

This paper cites VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.342768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.342768Z digest=sha256:fcba819b97b4d3cfc5dbcd9ae0be15f312419a756a1eb429fc1417634d5ed3c7

Observation ed228e8c-f02a-443c-a460-08c597959750 · outbound

This paper cites Learning transferable visual models from natural language supervision.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Learning transferable visual models from natural language supervision

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.458593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.458593Z digest=sha256:fb84bf2143bfeb0d3c5fbf16a441e9afd61de70cfbebeab54ea738f7f29613bd

Observation 3a655876-6a4f-45e3-9a8d-dfafe75eea61 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.597319Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.597319Z digest=sha256:05920277f9ed8e70f67cd5c0717742b162991395b4ff78ed293e4301446bf2dc

Observation da158765-d595-4c5f-9932-f501511c471a · outbound

This paper cites Introducing openai o1-preview.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Introducing openai o1-preview

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:35.278756Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:28.700760Z digest=sha256:3dc9c10eb767b6b333a996648d907a9573e31aed806b9ece5be5e4e7922c7993

Observation 560d7927-4d9c-46b4-a9ea-3c2666b317b7 · outbound

This paper cites R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:28.831793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:28.831793Z digest=sha256:a8cfa6371f23956b42c4ae1716494d9049e4314c9f176926cccfce66c6ab6952

Observation 47b2dc5f-db0e-4584-a974-4e11b75fa826 · outbound

This paper cites R1-v: Reinforcing super generalization ability in vision-language models with less than $3.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs R1-v: Reinforcing super generalization ability in vision-language models with less than $3

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:34.947632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:28.947669Z digest=sha256:83416ec7be6e7b1951341ec66630184fb824637670e3d613d68d0d4684bff63c

Observation 8ee8b4e6-4619-457f-98b9-377daf783e89 · outbound

This paper cites Visual-RFT: Visual Reinforcement Fine-Tuning.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Visual-RFT: Visual Reinforcement Fine-Tuning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.090072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.090072Z digest=sha256:5d67287582a5b442e0f4b47ad7b357335385a0e5ebcb2bef30eab55885f3b15d

Observation 79ac7303-9e85-429e-b7ef-91fbb3d54566 · outbound

This paper cites R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.190305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.190305Z digest=sha256:da50178f6c7a622f9c3832624046abb81142141ccfc42f3bf73b24596a898aae

Observation e247608d-0ad2-45c4-a8a6-31f7482a5684 · outbound

This paper cites Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning, 2025.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning, 2025

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.307567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.307567Z digest=sha256:1d6e91bb28b05677099ad52d26488b6b5eff5d6930bdd9074d5ec5b48b2146e3

Observation 2ddce2ba-3ff0-4111-84da-ff185ab93f68 · outbound

This paper cites Proximal Policy Optimization Algorithms.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Proximal Policy Optimization Algorithms

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.453912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.453912Z digest=sha256:16cc3911287c09025685ac4e29811176d3a105696cabcf8776edcc5948e99aa7

Observation b848829b-590c-4f91-a709-31e4c80891ab · outbound

This paper cites Referring expression comprehension: A survey of methods and datasets.IEEE Transactions on Multimedia, 23:4426–4440, 2020.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Referring expression comprehension: A survey of methods and datasets.IEEE Transactions on Multimedia, 23:4426–4440, 2020

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.595605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.595605Z digest=sha256:7436d44d393158c4220f9d55b0359d15baf904d4c09b52539434e192f5efc1bf

Observation efc784ed-8649-4591-8297-215f26b94ec2 · outbound

This paper cites GREC: Generalized Referring Expression Comprehension.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs GREC: Generalized Referring Expression Comprehension

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.730715Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.730715Z digest=sha256:cf12d3df8bab58d5725c1a3a758e0fbbe932a4dde853fbf90485227e82e7ccb6

Observation 3f1f2259-9bc5-412c-86b1-6bbafb1b0725 · outbound

This paper cites Vqa: Visual question answering.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Vqa: Visual question answering

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:29.866232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:29.866232Z digest=sha256:08fa44875713afbeab5e2e1e5d13a55391df5104453042e0139f58942b3677e7

Observation 93c76e6d-86e7-4cac-8e21-0a335cd68431 · outbound

This paper cites Visual question answering using deep learning: A survey and performance analysis.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Visual question answering using deep learning: A survey and performance analysis

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:34.683229Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:29.990414Z digest=sha256:a2f373b375d5cfa070f38a0b3d8c125a3528c281aa9af33e194287d218920b32

Observation d1215f91-3097-4af8-a453-d810d496f0a3 · outbound

This paper cites Generation and comprehension of unambiguous object descriptions.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Generation and comprehension of unambiguous object descriptions

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:30.088013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:30.088013Z digest=sha256:715f2e7d36595736635ad2af72a7ce878e55faeb3bf1f03780755d91a3bf03a9

Observation cbd0653d-6b7a-499c-b911-73639dfbb00b · outbound

This paper cites Modeling context in referring expressions.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Modeling context in referring expressions

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:30.226114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:30.226114Z digest=sha256:d5abfdc8f686b555c95aa4a56c8157eecdf53f15a5d489065380d4b0a07be4f3

Observation 5b3c60dd-f435-4b9f-afd3-793571be997d · outbound

This paper cites Generating easy-to-understand referring expressions for target identifications.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Generating easy-to-understand referring expressions for target identifications

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:34.379248Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:30.349318Z digest=sha256:7e74d95de67bd607e4c5a3c70f0152c3832e4cfe7d412bc1dfc9d49f51196fe4

Observation c7e28c85-9174-4f25-9be6-d027b2389de7 · outbound

This paper cites Lisa: Reasoning segmentation via large language model.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Lisa: Reasoning segmentation via large language model

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:30.483232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:30.483232Z digest=sha256:d23506577fd7edc7a25cc9aea1e4c2e3508dc64092930793e5dcb3a76a5f3fb7

Observation 83f6a806-eaf5-4f92-b3e0-654cc67cd64e · outbound

This paper cites R1-onevision: A unified benchmark for vision-language reasoning and generation, June.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs R1-onevision: A unified benchmark for vision-language reasoning and generation, June

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:34.126018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:30.607017Z digest=sha256:f99c1e8640c9df8dcfab9a0b0aae7501de6d2be890229577c92ede1eda3391ba

Observation fb81a721-d494-473d-9364-7158b7b72664 · outbound

This paper cites Are We on the Right Way for Evaluating Large Vision-Language Models?.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Are We on the Right Way for Evaluating Large Vision-Language Models?

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:30.818162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:30.818162Z digest=sha256:216e2a3cb770744dc961c7452dd0ee437ad27099da2a9994a438891049fb3232

Observation 8df142c1-5998-48fd-ab18-c34ac98e8928 · outbound

This paper cites A diagram is worth a dozen images.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs A diagram is worth a dozen images

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:30.889047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:30.889047Z digest=sha256:4e55cbe39ddc4b9fea5a7b34cfb6bd54c49f8f84deac431b8c5c7c040057945a

Observation 24dd8fe2-3296-47f5-833e-48517394d014 · outbound

This paper cites Infographicvqa.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Infographicvqa

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:33.599688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:30.974316Z digest=sha256:9e9c089bf7066f1aa748ad4465ca5c9ba79f7f3f3cef15cd70060ef1b052e715

Observation df1babcd-f7df-45b2-baaf-0b279b825e02 · outbound

This paper cites Towards vqa models that can read.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Towards vqa models that can read

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.032048Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.032048Z digest=sha256:42e7275e75d528a001b5f3293bc7cdcb0214edabf03a5adadf86025d949e908d

Observation 513391da-8308-4512-95bd-4deba6eb9cb8 · outbound

This paper cites Docvqa: A dataset for vqa on document images.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Docvqa: A dataset for vqa on document images

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.099093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.099093Z digest=sha256:0260f5bc789b5129592a030d134a07143b7e7a9b4fd168b08999ee829975f528

Observation 0fba8c8d-445b-475a-b9a0-c406363c3b4b · outbound

This paper cites Measuring multimodal mathematical reasoning with math-vision dataset.Advances in Neural Information Processing Systems, 37:95095–95169, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Measuring multimodal mathematical reasoning with math-vision dataset.Advances in Neural Information Processing Systems, 37:95095–95169, 2024

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.172238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.172238Z digest=sha256:fa392e1f7a2b2d1b1444562c887438d3b26febf724205204cb5d9516db240c28

Observation 21f31f13-f9d6-4de3-aa28-70385197870a · outbound

This paper cites Mmbench: Is your multi-modal model an all-around player?, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Mmbench: Is your multi-modal model an all-around player?, 2024

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.257117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.257117Z digest=sha256:c4f627f98dbc054dd8728ad9c1a20e2e1696f7cdcdb6a7150e86c1d54f05f6a0

Observation bfa9161d-c6a9-40fe-813e-5ed6289c45ed · outbound

This paper cites On the hidden mystery of ocr in large multimodal models.arXiv e-prints, pages arXiv–2305, 2023.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs On the hidden mystery of ocr in large multimodal models.arXiv e-prints, pages arXiv–2305, 2023

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:33.327754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:31.358887Z digest=sha256:afeed5adc390654f79cb7152d81397fe36ca90975955235f452cecec7e1937e7

Observation 50090ec8-945f-44e5-b00b-819a9d59a361 · outbound

This paper cites Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-08-07T13:51:32.636459Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:31.426677Z digest=sha256:2d2b8c13fd3cb03d8c9f7feb877e5254271f4a63c442822ad0e3638a517b6a9b

Observation faf6aee4-a806-4df9-9f53-7c57f8dfc09c · outbound

This paper cites Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:51:33.084907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:31.529362Z digest=sha256:b27704179275959d4978ad0cc1801cd9e54a49cf8d2d9f73f7cf318412e00e40

Observation 39b91a93-13e2-4b96-912d-4c0c9081f4f9 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs LLaVA-OneVision: Easy Visual Task Transfer

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.618670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.618670Z digest=sha256:d414e04524470af9912181f3c4b55b8e370085d371d174d92fa755dfa03f3255

Observation 0e0354f2-5db9-4aff-9a28-3b87a75ddefa · outbound

This paper cites MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.794999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.794999Z digest=sha256:eea82c0a8045c0b2f4a6b130bdfd948fca6ec7182ad8e48be71934c32834a524

Observation 50630a9e-7574-4e54-9ed4-5cffbbbbb7f1 · outbound

This paper cites Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:31.907314Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:31.907314Z digest=sha256:a1e8bc8cb42da49ff0866e9c0b72bb68a10da2aaacdb730ca27381c3fe87f63c

Observation 019551d9-c68a-4bf7-acad-7e23fd2cbdf4 · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:32.078030Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:32.078030Z digest=sha256:02be39a96288c6d788939a5d276edb3b1ae9ff81f2c6f94fb9da66ee0b47a7b3

Observation 090f1581-b4bf-455a-9812-f9122961da5c · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T13:51:32.247216Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:51:32.247216Z digest=sha256:448699d071dbbf4ed30070d1dbeb66a91ca7b51a8d89ac219ed264ff8254f202

Observation 930d8c78-b7c0-45b8-8292-63e104186493 · outbound

This paper cites an unresolved cited work.

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs Unresolved cited work

Reference 2024

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:51:33.835128Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T13:51:30.716013Z digest=sha256:b0f21aec205820e5a0bd67d68eeb289b69d1dc42cc2d2ed6c97cd0b741d8397a

Pith citing papers

Observation 5ae88b79-d5e3-4afc-bf32-456f4cc57230 · inbound

A Survey of Reinforcement Learning for Large Reasoning Models cites this paper.

A Survey of Reinforcement Learning for Large Reasoning Models TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Reference 249

Resolution
verified exact
arxiv_id, observed 2026-05-18T00:02:24.616376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-18T00:02:24.352947Z digest=sha256:436a31027006c393ce6fba10c13226e76a8e866cca5ae9b02162c55ee1e8798d

Observation e9b9c12a-8212-4ce8-b8bb-139bacd918d8 · inbound

Faithful Mobile GUI Agents with Guided Advantage Estimator cites this paper.

Faithful Mobile GUI Agents with Guided Advantage Estimator TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Reference 9

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T16:41:24.598890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-09T15:17:05.477466Z digest=sha256:e0810090d70b7f3ebe19f1f4fa7b99afb26ff34924f0b6001019412f4a92f7c6

Observation 643a9df2-e962-47c5-b9b4-fd16fbf27ffa · inbound

Trust Region On-Policy Distillation cites this paper.

Trust Region On-Policy Distillation TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Reference 4

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:56:13.698251Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-06-28T17:38:50.313305Z digest=sha256:1c91c61b54595250bf06c1686eee8a81ad258edc0345b60fba8631cae786cbaa

Observation 20f70eeb-b24b-419c-91bd-eea014b96751 · inbound

Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning cites this paper.

Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Reference 39

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T22:06:16.640147Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-06-28T15:45:26.891621Z digest=sha256:8da30902bb23fe5f3c9e9d51d9baa9adc60d94fdc029c93bbdb5cbc238105727

Observation fe678d8d-32ca-48e6-be9a-97308206e2ed · inbound

LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning cites this paper.

LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Reference 2026

Resolution
unresolved
no resolver link, observed 2026-08-01T18:40:14.013017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T18:40:14.013017Z digest=sha256:e51d4fd53459552454ddf207f7a62f50457dbf1311cbfc8b3a1eafc8b7346541