{"as_of":"2026-08-19T20:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b51c3f57bb4797bd921d0c406edb282494a9d9aba3ad005ca2eb5ac924a6d5c","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:51:32.247216Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:40:14.013017Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:06:16.638707Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"cited_work":{"arxiv_id":"2505.20777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20777","snapshot_observed_at":"2026-07-01T22:06:16.638707Z","title":"Taco: Think-answer consistency for optimized long-chain reasoning and efficient data learning via reinforcement learning in lvlms","venue":null,"work_id":"d1e02e6c-d4ca-47c3-9d62-d6ae988e3360","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":249,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.20777","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:d4390302bc367d1c00ac607a133e20850f92b63c20060284d92c12297650d802","observation_id":"5ae88b79-d5e3-4afc-bf32-456f4cc57230","resolution":{"observed_at":"2026-05-18T00:02:24.616376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"cited_work":{"arxiv_id":"2505.20777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20777","snapshot_observed_at":"2026-07-01T22:06:16.638707Z","title":"Taco: Think-answer consistency for optimized long-chain reasoning and efficient data learning via reinforcement learning in lvlms","venue":null,"work_id":"d1e02e6c-d4ca-47c3-9d62-d6ae988e3360","year":2025},"citing_paper":{"arxiv_id":"2605.01208","last_updated":"2026-05-02T02:54:36Z","snapshot_observed_at":"2026-08-11T20:05:21.702116Z","submitted_at":"2026-05-02T02:54:36Z","title":"Faithful Mobile GUI Agents with Guided Advantage Estimator","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T15:17:05.477466Z"},"links":{"cited_paper":"/paper/2505.20777","citing_paper":"/paper/2605.01208"},"observation_digest":"sha256:b7f0ce73848bd0a875d14b3e36bdc3ff1ebd08d415a31916b1fccee599f5c30a","observation_id":"e9b9c12a-8212-4ce8-b8bb-139bacd918d8","resolution":{"observed_at":"2026-05-11T16:41:24.598890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"cited_work":{"arxiv_id":"2505.20777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20777","snapshot_observed_at":"2026-07-01T22:06:16.638707Z","title":"Taco: Think-answer consistency for optimized long-chain reasoning and efficient data learning via reinforcement learning in lvlms","venue":null,"work_id":"d1e02e6c-d4ca-47c3-9d62-d6ae988e3360","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.20777","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:d5fafd3442e32814af6370d36f77075e6593626aa40bc8575b194f5766ba5310","observation_id":"643a9df2-e962-47c5-b9b4-fd16fbf27ffa","resolution":{"observed_at":"2026-07-01T20:56:13.698251Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"cited_work":{"arxiv_id":"2505.20777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20777","snapshot_observed_at":"2026-07-01T22:06:16.638707Z","title":"Taco: Think-answer consistency for optimized long-chain reasoning and efficient data learning via reinforcement learning in lvlms","venue":null,"work_id":"d1e02e6c-d4ca-47c3-9d62-d6ae988e3360","year":2025},"citing_paper":{"arxiv_id":"2606.01558","last_updated":"2026-06-01T02:02:23Z","snapshot_observed_at":"2026-08-04T16:32:29.186022Z","submitted_at":"2026-06-01T02:02:23Z","title":"Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T15:45:26.891621Z"},"links":{"cited_paper":"/paper/2505.20777","citing_paper":"/paper/2606.01558"},"observation_digest":"sha256:99f3bb9d7f3c4e577110b211d08503cd447ed0a776c1126987eae35f486fbd7d","observation_id":"20f70eeb-b24b-419c-91bd-eea014b96751","resolution":{"observed_at":"2026-07-01T22:06:16.640147Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20777","snapshot_observed_at":"2026-08-01T18:40:14.013017Z","title":"Taco: Think-answer consistency for optimized long-chain reasoning and efficient data learning via reinforcement learning in lvlms.arXiv preprint arXiv:2505.20777,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17243","last_updated":"2026-07-19T13:24:40Z","snapshot_observed_at":"2026-08-17T19:10:55.924823Z","submitted_at":"2026-07-19T13:24:40Z","title":"LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T18:40:14.013017Z"},"links":{"cited_paper":"/paper/2505.20777","citing_paper":"/paper/2607.17243"},"observation_digest":"sha256:5062acd0168bef794fd32180354f8940234699b239e2c4207d627b4c4bc0ad0b","observation_id":"fe678d8d-32ca-48e6-be9a-97308206e2ed","resolution":{"observed_at":"2026-08-01T18:40:14.013017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20777/citation-record","integrity":"/paper/2505.20777/integrity","json":"/paper/2505.20777/citation-record.json","paper":"/paper/2505.20777"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:26.367337Z","title":"Vision-language models for vision tasks: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:26.367337Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:48db926b2577287a8915706857f3bde981b3d28fe21859799db4d9d22c37f822","observation_id":"f73ea394-c64f-4ec3-960f-677426875167","resolution":{"observed_at":"2026-08-07T13:51:26.367337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:35.853603Z","title":"Show, attend and tell: Neural image caption generation with visual attention, 2016","venue":null,"work_id":"7ec39779-ee32-4eda-a359-1e13bc90019c","year":2016},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:26.444660Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:1e33b93bc762da0608202d40fae6a668b9faa94ea1f70a1d38cec511d76dab50","observation_id":"486103d8-e4af-4e90-b429-11ed3f5d70a7","resolution":{"observed_at":"2026-08-07T13:51:35.944372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:26.560212Z","title":"Lawrence Zitnick, Dhruv Batra, and Devi Parikh","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:26.560212Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:438475acb6d65238b4d4f8bb5b76ab60d3405a33d78e66900296a648aa506c17","observation_id":"031a92e9-f738-4004-83a3-6d55f0356d40","resolution":{"observed_at":"2026-08-07T13:51:26.560212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:51:26.647187Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:26.647187Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:5783519d4672bf8d211a1de645709bf9478873ff8656dc857336b8c71ee5f3d0","observation_id":"c85527a0-cded-4630-92f7-14800379efb6","resolution":{"observed_at":"2026-08-07T13:51:26.647187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:51:26.746276Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:26.746276Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:a6e6bdbc9c05549701f866ba3b6c393e3d484cbe5cf78946d97773b9cb81c70a","observation_id":"4658fd14-fb31-4d9e-aa57-4fc65c261901","resolution":{"observed_at":"2026-08-07T13:51:26.746276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:26.835457Z","title":"Deepseek- vl: Towards real-world vision-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:26.835457Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:4a485a5903addc89a61501eac0adc5e9868f2a32ed6b7e064ff37b2441a71c5e","observation_id":"577d6d7b-3301-454a-878e-baa80e0fd88d","resolution":{"observed_at":"2026-08-07T13:51:26.835457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:26.960508Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:26.960508Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:c7f277c57e49689cca2bcde616b246a76625bbc017f72921925f3c1e70b9cf58","observation_id":"7d5b3669-97ba-431a-81f4-3ecab4b991af","resolution":{"observed_at":"2026-08-07T13:51:26.960508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12945","last_updated":"2024-05-29T01:35:15Z","snapshot_observed_at":"2026-08-17T14:12:17.202003Z","submitted_at":"2023-10-19T17:41:48Z","title":"3D-GPT: Procedural 3D Modeling with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12945","snapshot_observed_at":"2026-08-07T13:51:27.058830Z","title":"3d-gpt: Procedural 3d modeling with large language models.arXiv preprint arXiv:2310.12945, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:27.058830Z"},"links":{"cited_paper":"/paper/2310.12945","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:0066d7cec2a51f97037934ab42c9dfdb068f477105f0494b19c85ef456235737","observation_id":"e0986aec-edef-4e42-b902-ccd81cca6c2c","resolution":{"observed_at":"2026-08-07T13:51:27.058830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:27.175131Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:27.175131Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:525e050668e08efa9dd9e7ad4fb16a68728b516a7a274e2715958a2132c50b1f","observation_id":"1a3d4937-1f3a-4212-bd29-b32096b4c599","resolution":{"observed_at":"2026-08-07T13:51:27.175131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:27.290047Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:27.290047Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:f589e8a6cc78ad4eafaa8c94c243d4aefff1b5445549b33c3e1fa2cb70f8b6f9","observation_id":"d678dc10-7f12-4c08-bc93-481545c78a48","resolution":{"observed_at":"2026-08-07T13:51:27.290047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:27.390953Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:27.390953Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:a06e6104a09ff3d341cd51c624fe8bdbc807205a6341fdb31bfd88b79bf77a60","observation_id":"3113d389-c779-4717-8fdd-cb8e2be1fa06","resolution":{"observed_at":"2026-08-07T13:51:27.390953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:27.556339Z","title":"Detecting and mitigating hallucination in large vision language models via fine-grained ai feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:27.556339Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:629e57329ac624853fb0982d39297fafc88bb5ea4691f83801b100344e9d2cf6","observation_id":"aeca7fdd-8e26-4d22-9f5f-eec800e2f97d","resolution":{"observed_at":"2026-08-07T13:51:27.556339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:35.463859Z","title":"Rlthf: Targeted human feedback for llm alignment, 2025","venue":null,"work_id":"7a1390ae-27a8-4d8c-af16-56f5269bba87","year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:27.707172Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:d28dc7d69c2bb7f1e67eb1e10e4c2dfa60b624edd1c83729e4c4b741d4d2f566","observation_id":"572ac910-67de-441d-8e6d-b4100e1d0a6d","resolution":{"observed_at":"2026-08-07T13:51:35.615617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:51:27.829573Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:27.829573Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:94d52498b9f6a1665700b75f05280eba1b55372ed70f5206963e40453a043e3a","observation_id":"c44f92de-bc07-45fa-9df4-1788652c6064","resolution":{"observed_at":"2026-08-07T13:51:27.829573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:27.965548Z","title":"Grpo-lead: A difficulty-aware reinforcement learning approach for concise mathematical reasoning in language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:27.965548Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:d4d1f8803436b33537a1a1df7335b54f18bc8fc98ab0d3415ef5cb029376b2c4","observation_id":"0b8f7dad-9b9a-4e45-a218-35b8531d00d2","resolution":{"observed_at":"2026-08-07T13:51:27.965548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-08-13T07:37:18.494967Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-07T13:51:28.087581Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution.arXiv preprint arXiv:2502.18449, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:28.087581Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:c7e116e6482be73d3fcea5ebd91de4e69473361a56adfcfff8872ed97de9d7b8","observation_id":"8011e1f4-495e-4e71-a275-5efd6e6df286","resolution":{"observed_at":"2026-08-07T13:51:28.087581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:28.230068Z","title":"Towards visual grounding: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:28.230068Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:33ec42110f0d73bacd5ee1729759d64b68ccd51764eb2d3efa96d1762a88a3ba","observation_id":"bfa8e2db-ff1b-47d4-84d4-4b85ce4f5afe","resolution":{"observed_at":"2026-08-07T13:51:28.230068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T13:51:28.342768Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:28.342768Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:919c957ea31de24e1616a7c07c232e319175dead71d6be069dd06c0a83d8ed32","observation_id":"64510dd2-04ee-4eac-9bc6-a3cffb2de1a9","resolution":{"observed_at":"2026-08-07T13:51:28.342768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:28.458593Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:28.458593Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:e66a97086458246fbcfcd857ac4cc2154eae7997d691f50e94b285ab47bf88c9","observation_id":"ed228e8c-f02a-443c-a460-08c597959750","resolution":{"observed_at":"2026-08-07T13:51:28.458593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:51:28.597319Z","title":"A versatile vision- language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:28.597319Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:56852e7cb11ce8863a1ab82917e0bba47111d7039ee6fc96a8802adce69f041b","observation_id":"3a655876-6a4f-45e3-9a8d-dfafe75eea61","resolution":{"observed_at":"2026-08-07T13:51:28.597319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:35.125360Z","title":"Introducing openai o1-preview","venue":null,"work_id":"fc3f7261-0b9b-4619-82bd-cebc449971c9","year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:28.700760Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:216279487e93fee55fb0c49a35d00fa2e2faa8815b811397cdce5a67857c75d2","observation_id":"da158765-d595-4c5f-9932-f501511c471a","resolution":{"observed_at":"2026-08-07T13:51:35.278756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T13:51:28.831793Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:28.831793Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:5ab6e87424b913ab74f5bb21ce05ba5665d16d5bf13a4e88691e157a40f3ece2","observation_id":"560d7927-4d9c-46b4-a9ea-3c2666b317b7","resolution":{"observed_at":"2026-08-07T13:51:28.831793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:34.850112Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3","venue":null,"work_id":"09378c44-97bb-4817-8c8a-c6a5852ee092","year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:28.947669Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:c1f3b9fcd8266686f76021f05e562d6aa6a6f237fbe8848e6975b65c83ca092b","observation_id":"47b2dc5f-db0e-4584-a974-4e11b75fa826","resolution":{"observed_at":"2026-08-07T13:51:34.947632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-19T07:59:58.721057Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T13:51:29.090072Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:29.090072Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:e57918029e1369be1f47ac78423b93bf9030a7de8112baead984a0a6899cc02c","observation_id":"8ee8b4e6-4619-457f-98b9-377daf783e89","resolution":{"observed_at":"2026-08-07T13:51:29.090072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-08-14T19:11:11.139675Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-07T13:51:29.190305Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:29.190305Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:ec7618e76fd15872702b7032b90c07d91f1ba5aabbafa99b46b36b7f09101bf8","observation_id":"79ac7303-9e85-429e-b7ef-91fbb3d54566","resolution":{"observed_at":"2026-08-07T13:51:29.190305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:29.307567Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:29.307567Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:4d72531fa1e6bc458b7ac87d81ec53bdd9046d103f068d8c84a2410722059c8c","observation_id":"e247608d-0ad2-45c4-a8a6-31f7482a5684","resolution":{"observed_at":"2026-08-07T13:51:29.307567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:51:29.453912Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:29.453912Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:fe3e3791ccc6ddc360071b9a1995582ea9a2b3ed913506d924bd34f82c657f82","observation_id":"2ddce2ba-3ff0-4111-84da-ff185ab93f68","resolution":{"observed_at":"2026-08-07T13:51:29.453912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:29.595605Z","title":"Referring expression comprehension: A survey of methods and datasets.IEEE Transactions on Multimedia, 23:4426–4440, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:29.595605Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:30f6ab3a5d8f47b135a292e775afdb00d1f8da57c26c2b9ffd2dd8ad664de19c","observation_id":"b848829b-590c-4f91-a709-31e4c80891ab","resolution":{"observed_at":"2026-08-07T13:51:29.595605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16182","last_updated":"2023-12-24T15:13:10Z","snapshot_observed_at":"2026-08-16T15:04:31.998061Z","submitted_at":"2023-08-30T17:58:50Z","title":"GREC: Generalized Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16182","snapshot_observed_at":"2026-08-07T13:51:29.730715Z","title":"Grec: Generalized referring expression comprehension.arXiv preprint arXiv:2308.16182, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:29.730715Z"},"links":{"cited_paper":"/paper/2308.16182","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:0970027fd29e12c71107d002a81ddafff9a9c971b7615332af6caa071da1983c","observation_id":"efc784ed-8649-4591-8297-215f26b94ec2","resolution":{"observed_at":"2026-08-07T13:51:29.730715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:29.866232Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:29.866232Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:5d7ae837d288a066d115c814de23997983f7cdcd68c0ed1442074557a89e1604","observation_id":"3f1f2259-9bc5-412c-86b1-6bbafb1b0725","resolution":{"observed_at":"2026-08-07T13:51:29.866232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:34.536651Z","title":"Visual question answering using deep learning: A survey and performance analysis","venue":null,"work_id":"e3503a8e-63eb-418c-846b-929f59c2a207","year":2020},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:29.990414Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:d30d33f9e74ce38b3b2a557f277ebbb44db2e62af4ba9e2671fdd4984b483334","observation_id":"93c76e6d-86e7-4cac-8e21-0a335cd68431","resolution":{"observed_at":"2026-08-07T13:51:34.683229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:30.088013Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:30.088013Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:92d2d72d02225ead7920041c2ed4f6aa08e9c05eea52f7067bd9968d856f986c","observation_id":"d1215f91-3097-4af8-a453-d810d496f0a3","resolution":{"observed_at":"2026-08-07T13:51:30.088013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:30.226114Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:30.226114Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:749a449fb533a0e29387ec21348d3222d51c7235cc751cce94688f527cef1efa","observation_id":"cbd0653d-6b7a-499c-b911-73639dfbb00b","resolution":{"observed_at":"2026-08-07T13:51:30.226114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:34.251784Z","title":"Generating easy-to-understand referring expressions for target identifications","venue":null,"work_id":"0a2e058a-d734-4dcf-ad87-216d9d0efa6e","year":2019},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:30.349318Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:8197d2df194190b016fe2083583f3009a443613e8deeaced3643690ca0e6bfbf","observation_id":"5b3c60dd-f435-4b9f-afd3-793571be997d","resolution":{"observed_at":"2026-08-07T13:51:34.379248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:30.483232Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:30.483232Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:734e83954d5b11fa3111235d161af8061eb43fd79d3241bab7ea1c8ac41f7a85","observation_id":"c7e28c85-9174-4f25-9be6-d027b2389de7","resolution":{"observed_at":"2026-08-07T13:51:30.483232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:33.980357Z","title":"R1-onevision: A unified benchmark for vision-language reasoning and generation, June","venue":null,"work_id":"559cfcf6-85b4-488b-94fa-3bf38c742c38","year":null},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:30.607017Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:a3f1c8ec42a9b33aa7254cdc1cce121be14af29c7f8d3f0a2d6b7c1dc7d5e644","observation_id":"83f6a806-eaf5-4f92-b3e0-654cc67cd64e","resolution":{"observed_at":"2026-08-07T13:51:34.126018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T13:51:30.818162Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:30.818162Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:7074766d8b5dd96144a5f7d379ebdcc9231e9ae0aeb5764a983da232040d6695","observation_id":"fb81a721-d494-473d-9364-7158b7b72664","resolution":{"observed_at":"2026-08-07T13:51:30.818162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:30.889047Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:30.889047Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:227733fd439728c3b3c924a271078ebb360288dd4eb23d895db64877387704b9","observation_id":"8df142c1-5998-48fd-ab18-c34ac98e8928","resolution":{"observed_at":"2026-08-07T13:51:30.889047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:33.495695Z","title":"Infographicvqa","venue":null,"work_id":"2c22e457-3409-4405-b182-1c0f2d6993d9","year":2022},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:30.974316Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:957bfe6d084489138fc3e55b3e431904f6a369e3746f0563031a178fe0126b7c","observation_id":"24dd8fe2-3296-47f5-833e-48517394d014","resolution":{"observed_at":"2026-08-07T13:51:33.599688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:31.032048Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:31.032048Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:5175278c7244d27d3ae25dbc8abfd8fb4ab6d8a687a438bbe80ac9068a801a62","observation_id":"df1babcd-f7df-45b2-baaf-0b279b825e02","resolution":{"observed_at":"2026-08-07T13:51:31.032048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:31.099093Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:31.099093Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:12bae69f7cb20c59396aa2566e40c93a17017772e6abd6475d5327511cf6626e","observation_id":"513391da-8308-4512-95bd-4deba6eb9cb8","resolution":{"observed_at":"2026-08-07T13:51:31.099093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:31.172238Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.Advances in Neural Information Processing Systems, 37:95095–95169, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:31.172238Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:783f3c5385be2ffd91844bbb1b0721a0f95a90d5b304e540b9cd189fe3c3cf23","observation_id":"0fba8c8d-445b-475a-b9a0-c406363c3b4b","resolution":{"observed_at":"2026-08-07T13:51:31.172238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:31.257117Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:31.257117Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:00bf4ce145ef63056c24b0cbae44c0d560ce22511d7311ac7bb74fc79f40a1c2","observation_id":"21f31f13-f9d6-4de3-aa28-70385197870a","resolution":{"observed_at":"2026-08-07T13:51:31.257117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:33.234166Z","title":"On the hidden mystery of ocr in large multimodal models.arXiv e-prints, pages arXiv–2305, 2023","venue":null,"work_id":"8cee92ea-8385-43cb-865c-fceee83392da","year":2023},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:31.358887Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:ce1898539e0d08110edbf1c54c35efac600b36123879b8fb2b40e702236c9236","observation_id":"bfa9161d-c6a9-40fe-813e-5ed6289c45ed","resolution":{"observed_at":"2026-08-07T13:51:33.327754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01416","last_updated":"2025-01-02T18:57:59Z","snapshot_observed_at":"2026-08-10T22:25:53.363640Z","submitted_at":"2025-01-02T18:57:59Z","title":"Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension","version":1},"cited_work":{"arxiv_id":"2501.01416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01416","snapshot_observed_at":"2026-08-07T13:51:32.519142Z","title":"Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension","venue":"cs.CV","work_id":"d73f4b95-08f3-4233-8955-8bd8d000250b","year":2025},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:31.426677Z"},"links":{"cited_paper":"/paper/2501.01416","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:751bdedd1b26598118272131ab98ebfb9d12dcf3ccab55d02e8194cb7ef67af6","observation_id":"50090ec8-945f-44e5-b00b-819a9d59a361","resolution":{"observed_at":"2026-08-07T13:51:32.636459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:32.978473Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024","venue":null,"work_id":"982155e8-4a7d-4844-82bf-ecb12cf19933","year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:31.529362Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:36b999ee38914f70e20a13da6e2c4cdd24250dd64d6239458eb8b13ba0f90642","observation_id":"faf6aee4-a806-4df9-9f53-7c57f8dfc09c","resolution":{"observed_at":"2026-08-07T13:51:33.084907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:51:31.618670Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:31.618670Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:8b616444a1bdeac52c52f533644759bb8ef102ea49fdb1f1ff2097a13de7deff","observation_id":"39b91a93-13e2-4b96-912d-4c0c9081f4f9","resolution":{"observed_at":"2026-08-07T13:51:31.618670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-17T05:08:32.494949Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-07T13:51:31.794999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:31.794999Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:3b6d8d2386f14a5d8fc16cdf4cdde9e064faade2684c85252c10fe6f1927b2e1","observation_id":"0e0354f2-5db9-4aff-9a28-3b87a75ddefa","resolution":{"observed_at":"2026-08-07T13:51:31.794999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T13:51:31.907314Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:31.907314Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:d851587aa5941a0fa90268b5b33aa10da0e1217452af4af6ac41f4fd69c22fd3","observation_id":"50630a9e-7574-4e54-9ed4-5cffbbbbb7f1","resolution":{"observed_at":"2026-08-07T13:51:31.907314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T13:51:32.078030Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:32.078030Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:db460e3567c040a54fa7a52f22d36542d5d12ca8c50f28ee16b82b2c99d9af05","observation_id":"019551d9-c68a-4bf7-acad-7e23fd2cbdf4","resolution":{"observed_at":"2026-08-07T13:51:32.078030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:51:32.247216Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:32.247216Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:8aa8f2e58dcfbfdb7104b90b3d584d8f89179a83b931485adc5f9c1e6511e6b6","observation_id":"090f1581-b4bf-455a-9812-f9122961da5c","resolution":{"observed_at":"2026-08-07T13:51:32.247216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:33.736441Z","title":null,"venue":null,"work_id":"4e183430-2cca-4a0d-acc8-c8d9830065bd","year":null},"citing_paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:30.716013Z"},"links":{"citing_paper":"/paper/2505.20777"},"observation_digest":"sha256:dfc34c81e30d2249510c78043ea56b89b697b300084e033dad9083600a77c301","observation_id":"930d8c78-b7c0-45b8-8292-63e104186493","resolution":{"observed_at":"2026-08-07T13:51:33.835128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20777","last_updated":"2025-05-27T06:30:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T17:01:47.340454Z","submitted_at":"2025-05-27T06:30:48Z","title":"TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 5 inbound Pith citation observations for arXiv:2505.20777."}