{"as_of":"2026-08-15T18:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:292118359ab2baed3aef9a7ed192315286114cd6d5fe4a3a87db441e076f81ac","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:41:07.654957Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10758/citation-record","integrity":"/paper/2412.10758/integrity","json":"/paper/2412.10758/citation-record.json","paper":"/paper/2412.10758"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T15:41:07.405342Z","title":"Unveili ng encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.405342Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:0783450406706fc62773cefbe1bbc8d47123673cbfc1a84482b4233d12edae78","observation_id":"de7930ef-f9ba-4cdf-8795-e67183fa8da3","resolution":{"observed_at":"2026-08-11T15:41:07.405342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19732","last_updated":"2024-12-20T16:19:17Z","snapshot_observed_at":"2026-08-14T06:22:20.361501Z","submitted_at":"2024-10-25T17:59:09Z","title":"Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19732","snapshot_observed_at":"2026-08-11T15:41:07.418467Z","title":"Rethinking visual de pendency in long-context reasoning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.418467Z"},"links":{"cited_paper":"/paper/2410.19732","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:e66899c95c8aa3dda5eac573d94c9c6d81758e305a111a902a03cc27d55e80d9","observation_id":"0f3c027a-23f5-49e5-bf7b-c9340a66c595","resolution":{"observed_at":"2026-08-11T15:41:07.418467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.424605Z","title":"Visual in-context le arning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.424605Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:d70646201dce3a0b325a999fcbdb9a8b3a87da6969df47250f917fe2321ebfce","observation_id":"29fe954b-93b0-43eb-ba0b-5604e6484cf9","resolution":{"observed_at":"2026-08-11T15:41:07.424605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:08.034461Z","title":"Claret: P re-training a correlation-aware context-to-event transformer for eve nt-centric gener- ation and classiﬁcation,","venue":null,"work_id":"daa0c00a-882a-4cfb-9f65-cb4fb26acde7","year":2022},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.434018Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:58fe086e00cd5fc475e27e7db331412abccf6a4cbc398ff717bdc8b7eb9c7e8a","observation_id":"7c6a1830-2b1b-448d-9a27-2f52f892de80","resolution":{"observed_at":"2026-08-11T15:41:08.041191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.439801Z","title":"Eventber t: A pre- trained model for event correlation reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.439801Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:4a15ccb4ed23840961cb410ddae8d52c754eae8cc3ef21394f7deea55c8cb6e2","observation_id":"884311d6-0dfb-43ad-acea-83f94f7efda6","resolution":{"observed_at":"2026-08-11T15:41:07.439801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:08.001307Z","title":"Visionllm: Large language mode l is also an open-ended decoder for vision-centric tasks,","venue":null,"work_id":"f051bb42-0590-49eb-b0c4-af3653b3a5d9","year":2023},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.445111Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:c769f6ad64ca3231383eef91ce1a0c1b5f86cb4140afa15a47069d02af5e6810","observation_id":"0f360099-d185-4b02-80c6-1149ae41d554","resolution":{"observed_at":"2026-08-11T15:41:08.006708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-12T23:44:22.154771Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-11T15:41:07.450255Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.450255Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:7ffb9155fe114e42e56c2bdf4d2901c7d1d2dbde220bfc6fbb6d1dbc1c79aefc","observation_id":"8c35f26c-cc7b-4475-89e5-dd16497b03d6","resolution":{"observed_at":"2026-08-11T15:41:07.450255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-11T15:41:07.456101Z","title":"Moe-llava: Mixture of experts for large vision -language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.456101Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:3c8cea0ae73f69ae003f9a2814bb838db117fd38c709de81734cab2a9139fde1","observation_id":"d2fb4fb8-c10f-4b83-9891-1ae0033fe3ed","resolution":{"observed_at":"2026-08-11T15:41:07.456101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19716","last_updated":"2024-11-24T03:47:38Z","snapshot_observed_at":"2026-08-12T23:54:33.713097Z","submitted_at":"2024-05-30T05:53:49Z","title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19716","snapshot_observed_at":"2026-08-11T15:41:07.461270Z","title":"Enhancing large vision language models with self- training on image comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.461270Z"},"links":{"cited_paper":"/paper/2405.19716","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:89547d768ae66e668b8765a0ef015fb392ba7585fbde3bfbfad9177b3f299a4d","observation_id":"dffc29d3-fe2f-412e-94bb-ab98399cc140","resolution":{"observed_at":"2026-08-11T15:41:07.461270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-08-13T01:47:35.713102Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-11T15:41:07.467266Z","title":"Fine-tuning large vision-language models as decision-making agents via rein forcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.467266Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:e09056234e32cfbc233f5a169be1b6c097a5cc0d04602843c639fa634e1ffb37","observation_id":"efdb86d5-6a57-4f20-8773-6fa05cfdb689","resolution":{"observed_at":"2026-08-11T15:41:07.467266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.473518Z","title":"Triple sequence generati ve adversarial nets for unsupervised image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.473518Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:c080f146cb3fe2bf214dee7bdfe7c58bcc322be959bb4d8e9076ad4bdc0eca77","observation_id":"69dd160d-b850-46cc-9e8e-b2abe60ea223","resolution":{"observed_at":"2026-08-11T15:41:07.473518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.605049Z","title":"Sketch storytelling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.605049Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:ce86128b000063426773bae4c91a7dccd14c457add4fb3172da396185d8e62c8","observation_id":"79da6fd4-c041-4c53-b86b-d7ba60b2fd29","resolution":{"observed_at":"2026-08-11T15:41:07.605049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T15:41:07.611175Z","title":"Are we on the right way fo r evaluating large vision-language models?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.611175Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:3e2097a820b8aebb8e5109681416e64102d8f8eb82dc2ad2dd41bb8c10e4a715","observation_id":"08ee393c-8162-45b1-a029-1bcd41085a7a","resolution":{"observed_at":"2026-08-11T15:41:07.611175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T15:41:07.634043Z","title":"Internvl: Scaling up vision foundation models and alignin g for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.634043Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:56197c6b1dd26828194b20dfc4660c6539b6c473eed1127aa41067584bf5673f","observation_id":"6d269bcc-721f-4cba-ab9b-9803bb332f29","resolution":{"observed_at":"2026-08-11T15:41:07.634043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T15:41:07.628483Z","title":"Available: https://doi.org/10.48550/ar Xiv.2403.20330","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.628483Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:f288f6cdd7ec552a89a593a168b493d2e0a97448bb9f95bade2b7a1eef22c6f3","observation_id":"47267141-3a43-4ce5-9677-5de5bbb57551","resolution":{"observed_at":"2026-08-11T15:41:07.628483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.645686Z","title":"Multimodal event transformer for i mage-guided story ending generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.645686Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:e350ab723b8d235fd066d6eba112aa39bdbf5a8b3d9d0fa01f2be524d3913d3c","observation_id":"2e08b26e-817c-4f41-9012-f37a34ff83ae","resolution":{"observed_at":"2026-08-11T15:41:07.645686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-08-12T22:28:53.225342Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-08-11T15:41:07.639261Z","title":"Texthawk2: A large vi sion- language model excels in bilingual OCR and grounding with 16 x fewer tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.639261Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:f52c592eaac4ad5521b4aa73a3e80733081b58e1667975a19372266d6b86c3d2","observation_id":"290f8d76-452e-4d2d-bfc2-4da99cfc6534","resolution":{"observed_at":"2026-08-11T15:41:07.639261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.928825Z","title":"Vilt: Vision-and-language t ransformer without convolution or region supervision,","venue":null,"work_id":"8a5c4521-8449-4ad9-a27e-9fcb4434f33d","year":2021},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.654957Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:48a5c28a016b664d914ad7dd90971def825277f87ee85f0306a5cd7f9d67a423","observation_id":"aa2f60fb-8b6b-4693-8d29-832a263aaa79","resolution":{"observed_at":"2026-08-11T15:41:07.935301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:41:07.948062Z","title":"Style-aware contrastive learning for multi-styl e image caption- ing,","venue":null,"work_id":"0cfd2e5c-2953-4103-b2ad-f7d368bd60e6","year":2023},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.650306Z"},"links":{"citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:a265cd77b46f10634305185b8928deda61f5c8a2507e899e591b48f234d7b5a3","observation_id":"5b40c818-fa1b-4aaa-a51c-8228ed812c57","resolution":{"observed_at":"2026-08-11T15:41:07.953949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T15:41:07.412311Z","title":"Available: https://doi.org/10.48550/ar Xiv.2406.11832","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.412311Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:4d5d21e283b44e06dede65cc745bc8b106711ba97c8aa195850514f8f8c9635c","observation_id":"d9efcc2f-8978-4d23-97a8-97fad21a7f40","resolution":{"observed_at":"2026-08-11T15:41:07.412311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2412.10758."}