{"as_of":"2026-08-10T07:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce36882d34f147e74f6408384d628944f97de7bd44bc309d7747a81454418128","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:31:25.742591Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:39:56.491911Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-15T02:43:47.775691Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2305.03726"},"observation_digest":"sha256:5d5429784befce12c519378ac6a702a629123c5406e5610246dada20beb5c65d","observation_id":"d4bfc8e1-85d5-47e8-bb2f-fba9bc7fdeb5","resolution":{"observed_at":"2026-05-15T02:43:47.915256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T08:13:18.191233Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2308.12067"},"observation_digest":"sha256:2acb88388af81f1082409555746e5827bbeb779e4977b8490f4d4f591b63ba50","observation_id":"9f0d2089-6468-4dae-8b88-6b1cde9056d4","resolution":{"observed_at":"2026-05-24T08:14:10.243558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T19:11:33.783746Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2310.03744"},"observation_digest":"sha256:a40643c5a43797bc61210b2fcfc4212f10e953c029dd495e45fd80a2ee829950","observation_id":"f81cb006-3de7-4356-a7d2-478facbfd48b","resolution":{"observed_at":"2026-05-12T19:11:33.983508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T01:22:04.035994Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2310.14566"},"observation_digest":"sha256:251122911cda56676597a9ff1c21d0f1dac0e85545c69c1a3c857bd193335385","observation_id":"3d5da0f1-f352-4fc5-ad69-54e92950cc89","resolution":{"observed_at":"2026-05-17T01:22:04.209988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:3f85cf00c7879493a8354f04dd56ae432b13a357d602e686d34cff5206d1b3bc","observation_id":"752f4153-e37b-4e86-9fd2-0590c19295c6","resolution":{"observed_at":"2026-05-13T22:46:10.257255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T02:33:30.143907Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2401.15947"},"observation_digest":"sha256:f75049f1d29611cdde73b54fb00de84a9bf968e783c0f69b7ceb622074071a42","observation_id":"0ee7bdb2-737a-4bac-bedd-c87c5c5dc7ec","resolution":{"observed_at":"2026-05-16T02:33:30.227169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-13T05:47:27.775529Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2403.04652"},"observation_digest":"sha256:d36cb2720cbf211cd9c331b3e37a37d812d5344b147a57fa28345dab9eeb99e3","observation_id":"da761b21-bc1c-4309-9a6b-0202105cea7a","resolution":{"observed_at":"2026-05-13T05:47:27.946357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:d92911677ceb16ad21d27c590e6844f9300e51af5bcf04882cb4024b838452c9","observation_id":"40490174-7897-4290-ba07-fe31d5bcba88","resolution":{"observed_at":"2026-05-15T22:48:36.149695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-05-17T00:05:03.547664Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2406.16860"},"observation_digest":"sha256:49fcf3e018ef883f6fb1764dcfbff942ec8fd58c4248d8e7df4e698abdf4dd55","observation_id":"7961a538-9c52-4f4e-b58f-0293a8b8c28b","resolution":{"observed_at":"2026-05-17T00:05:03.865968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:462031ecb5821879a977d03b831889a4874e95fcd9dffa7da0f3c8ac28ea3642","observation_id":"a0c9ca41-5014-4f37-9a4e-26ea794e962c","resolution":{"observed_at":"2026-05-10T21:07:32.151963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:f5cc8b2add7b4dcaeb4397719b20d21975abe9fe81aadc8714ebc219dc44861a","observation_id":"43929916-c215-4956-965e-51a3ddd062bb","resolution":{"observed_at":"2026-05-10T14:23:49.586902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:effec1aa279be086722cda9ccf71723f9f77b7d5908affae2eef4f98b0f142dc","observation_id":"7d29eb95-245f-4fdb-a75d-d9ca6d406c35","resolution":{"observed_at":"2026-05-23T07:42:43.046117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-17T07:51:12.953777Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.14164"},"observation_digest":"sha256:c177c339b24662717384ca2efbe8bf7dfed83d83885a6239c493000608986ad3","observation_id":"0ade628d-a4e4-4dfa-9dd1-ceeb3e3f2dc9","resolution":{"observed_at":"2026-05-17T07:51:13.090250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:9e053394c83656a8473c6eacc452e5b25a29b74051ab7ad24d27f91d5728c1c1","observation_id":"a793304d-b92d-4fa4-8199-35015e9dc1ae","resolution":{"observed_at":"2026-05-17T20:33:26.773900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-09T17:58:57.493585Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image under- standing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00735","last_updated":"2025-05-18T07:29:41Z","snapshot_observed_at":"2026-08-09T17:52:23.675175Z","submitted_at":"2025-02-02T10:05:08Z","title":"`Do as I say not as I do': A Semi-Automated Approach for Jailbreak Prompt Attack against Multimodal LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T17:58:57.493585Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2502.00735"},"observation_digest":"sha256:25fe4fa93383ff8f0be4786c6bdc1cf207a91f53f94e89fa3085d3db0a611655","observation_id":"529a65a7-b01c-4a52-a470-69a8269c1b7d","resolution":{"observed_at":"2026-08-09T17:58:57.493585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-09T15:04:40.287500Z","title":"LLaV AR: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01524","last_updated":"2025-02-03T17:01:59Z","snapshot_observed_at":"2026-08-09T21:17:23.790261Z","submitted_at":"2025-02-03T17:01:59Z","title":"Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective","version":1},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:40.287500Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2502.01524"},"observation_digest":"sha256:c13b2588bcc51dc392450a111131ce935c9f30f0bc5e4a877e8262be85212a50","observation_id":"9f238bba-9232-4aa9-a2d4-a321631dae86","resolution":{"observed_at":"2026-08-09T15:04:40.287500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:2b4f615929c46c62a307f4e11eec277e79e977d1c429db596de74546bc10169f","observation_id":"e83eed00-f88e-40ce-8d5a-061b7c511f41","resolution":{"observed_at":"2026-05-22T19:52:01.814828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2505.17726","last_updated":"2026-05-19T09:55:01Z","snapshot_observed_at":"2026-08-03T09:08:10.935540Z","submitted_at":"2025-05-23T10:43:45Z","title":"Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-22T02:06:35.204166Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.17726"},"observation_digest":"sha256:f2315a662f88a5414ee512f6551a13882d40e365d7f0b73a4e3e6007e3013d77","observation_id":"b4f09d17-eaf0-4993-bfdf-572bab3e51df","resolution":{"observed_at":"2026-05-22T02:10:56.107060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T14:37:54.258922Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.258922Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:fc27693fcffb1d80470cec685261e2c85d9132244326f526a7036808f690528c","observation_id":"a346cf23-6cad-4a8b-867c-efcd33e76a44","resolution":{"observed_at":"2026-08-07T14:37:54.258922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T14:04:57.989894Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.989894Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:aecf7db498d2235e4a527bd65e3fc44b3802c58fe28b0502c71746dcdb62fc49","observation_id":"b6e354e6-b377-4bf1-90e4-2954bd1181c7","resolution":{"observed_at":"2026-08-07T14:04:57.989894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T14:02:52.067992Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding.arXiv preprint arXiv:2306.17107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.067992Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:2bcde08954a9273d706499d0237d2a4cda37fefc709aa5307354fa8f0070ba24","observation_id":"89728534-4ffa-413d-875c-af011ef21c29","resolution":{"observed_at":"2026-08-07T14:02:52.067992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T12:42:27.922748Z","title":"LLaV AR: En- hanced visual instruction tuning for text-rich image under- standing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-08T00:05:10.710300Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:27.922748Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:0db34efcc2d7f8b68ad29fb2d90496c6c95291838c8fbf89f3425a210882f3fe","observation_id":"e5a0e74d-ac7d-4915-8c45-3e16b5a9adaa","resolution":{"observed_at":"2026-08-07T12:42:27.922748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T06:02:30.509268Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.509268Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:370a97f9f2fa7bd31a2aa8268a90bfa9bafef928b68c955554b886da933a7c43","observation_id":"b6a9aadf-9721-470a-a358-3ea30994739c","resolution":{"observed_at":"2026-08-07T06:02:30.509268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T05:34:56.492581Z","title":"Llavar: Enhanced visual instruction tuning for text-rich im- 14 age understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.492581Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:597d8e73fbd72edced34303df4b4a260c6d2288e643e6324e3373e9edd5b1442","observation_id":"ccec615d-d13e-4de7-ba4d-53c35f5b8de5","resolution":{"observed_at":"2026-08-07T05:34:56.492581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T23:57:28.750521Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:28.750521Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:5e0d343c18a48add0176f7147dd07c0e2f9e8436aaec236d69cd9646ec5ffa4b","observation_id":"b24f0e5f-e49b-4afd-83d0-bc32bddfb148","resolution":{"observed_at":"2026-08-06T23:57:28.750521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T20:25:23.916976Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image under- standing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02804","last_updated":"2026-06-28T12:40:31Z","snapshot_observed_at":"2026-08-08T16:13:23.244408Z","submitted_at":"2025-07-03T17:07:20Z","title":"Multimodal Mathematical Reasoning with Diverse Solving Perspective","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:23.916976Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.02804"},"observation_digest":"sha256:e9be5268700b7334455ded2e450ae43887415394db045f1fa5621e15fc4c814c","observation_id":"a96f1011-b795-4124-9646-29a6fe338376","resolution":{"observed_at":"2026-08-06T20:25:23.916976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T18:43:21.283146Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-09T20:40:39.623259Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.283146Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:ffcfe02425d790ab2a6e5b772917ef6161c3f61f91cdae5f58f6926e1894b9dc","observation_id":"568769e4-9114-4bd8-9e2e-fe8d9b7c8914","resolution":{"observed_at":"2026-08-06T18:43:21.283146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T18:24:54.680277Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.680277Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:1162f6bf569719fb2027550da9340af5b02f68187dbe0bd2cf8ec3263c004805","observation_id":"40b253b0-067d-4f80-b54f-90b17167e97a","resolution":{"observed_at":"2026-08-06T18:24:54.680277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T17:59:07.601054Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:07.601054Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:521c7abe7febd88b2393363de13e98c07311eaa0dbfbe798e214742c453e7dc2","observation_id":"1a888602-e291-42c8-9625-1461a92fcc8a","resolution":{"observed_at":"2026-08-06T17:59:07.601054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2507.09861","last_updated":"2026-04-21T13:31:05Z","snapshot_observed_at":"2026-07-06T21:56:35.665677Z","submitted_at":"2025-07-14T02:10:31Z","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-19T04:38:49.512293Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.09861"},"observation_digest":"sha256:ef55166b0222cc51caca7b86113bdc81775a75619fd1d5d6ddccb6744e886936","observation_id":"7b8f319d-4258-4591-95f7-2899fd3f623a","resolution":{"observed_at":"2026-05-19T04:42:04.346263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T15:14:17.448064Z","title":"Zhao, Y .; Zhang, H.; Xie, L.; Hu, T.; Gan, G.; Long, Y .; Hu, Z.; Chen, W.; Li, C.; Xu, Z.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16878","last_updated":"2025-07-22T12:29:13Z","snapshot_observed_at":"2026-08-09T16:03:32.935657Z","submitted_at":"2025-07-22T12:29:13Z","title":"CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:17.448064Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.16878"},"observation_digest":"sha256:62bd4f4c8946e848f2d4ce9de3140f922df641d15379401bc9e0b1fb0918e53d","observation_id":"e5af482a-0791-40c7-92f8-9b122181d297","resolution":{"observed_at":"2026-08-06T15:14:17.448064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-05T17:13:08.096024Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.096024Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:536812564a4cc722471f03dbff98befa3206bc46d4cbf80c1ca9df57d443c8e2","observation_id":"9f7999db-19ce-4621-af6c-b8935cf10a27","resolution":{"observed_at":"2026-08-05T17:13:08.096024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2605.00877","last_updated":"2026-05-06T12:52:11Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-04-25T14:53:37Z","title":"OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T20:50:57.818064Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2605.00877"},"observation_digest":"sha256:5b8854c58fe0c1c16ab06342563259a124b5429cc39b9d2016df549bc9a92dc9","observation_id":"2bbfdfc6-adfc-4968-8047-9ba9f6bab163","resolution":{"observed_at":"2026-05-11T14:56:06.970215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2605.03426","last_updated":"2026-05-05T07:02:50Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:02:50Z","title":"Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-07T04:07:58.031100Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2605.03426"},"observation_digest":"sha256:bba713302eaa867b511a842a83349fed028e6df343b88b22ca4db70cb9c1b1fa","observation_id":"000e01be-5b7f-4368-870a-4cb39fd6e76e","resolution":{"observed_at":"2026-05-12T10:41:30.856645Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2606.07289","last_updated":"2026-06-05T14:00:47Z","snapshot_observed_at":"2026-08-01T07:32:32.007503Z","submitted_at":"2026-06-05T14:00:47Z","title":"Closed-Form Spectral Regularization for Multi-Task Model Merging","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-27T22:40:00.510742Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2606.07289"},"observation_digest":"sha256:e2be6de970055940ad5afd1ecc75be1fcf17da8492c7502ab1824f57cb3f98c1","observation_id":"d7ab97c0-7887-4c80-bb99-5e36e3e042cc","resolution":{"observed_at":"2026-07-02T16:27:09.385400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2606.09132","last_updated":"2026-06-08T07:30:20Z","snapshot_observed_at":"2026-08-05T18:32:48.128378Z","submitted_at":"2026-06-08T07:30:20Z","title":"Vision Language Model Helps Private Information De-Identification in Vision Data","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T16:29:33.294960Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2606.09132"},"observation_digest":"sha256:43af6a49256f74157c91ac4c00509f73872781770f663edd4351ce5ab8b29f3d","observation_id":"b85f4393-3752-4c7b-afd8-3bd4d3ec02eb","resolution":{"observed_at":"2026-07-03T01:27:31.578905Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":228,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:7f4118380f34f30954026656a2bdfe973ae594f83d373c4d3ea4591ae8497b87","observation_id":"c5bd9300-5a26-42df-9cc6-136b81cfbea2","resolution":{"observed_at":"2026-07-03T10:48:03.219425Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2606.26287","last_updated":"2026-06-24T18:34:00Z","snapshot_observed_at":"2026-07-07T00:00:36.766142Z","submitted_at":"2026-06-24T18:34:00Z","title":"GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-26T01:32:40.435742Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2606.26287"},"observation_digest":"sha256:6f0cc222736ca7f2727330dd75f689100d158018d339774f0eb0b5cb3287719f","observation_id":"422eb2e9-c7f5-49af-a622-94650ef89f12","resolution":{"observed_at":"2026-07-04T15:39:56.493243Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding.arXiv preprint arXiv:2306.17107, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:4191d3e3c4771ee3d54a90158ffa496ff68d7c7112132036895269f9aa99358c","observation_id":"929cea13-7215-4400-b797-b5db081d1334","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-01T04:30:11.681602Z","title":"arXiv preprint arXiv:2306.17107 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22531","last_updated":"2026-07-24T17:59:39Z","snapshot_observed_at":"2026-08-07T13:04:18.211748Z","submitted_at":"2026-07-24T17:59:39Z","title":"Twins: Learn to Predict Unified Representations with Focal Loss","version":1},"reference_index":282,"source":"arxiv_source","source_observed_at":"2026-08-01T04:30:11.681602Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2607.22531"},"observation_digest":"sha256:8ffc352d399aab5c711c85215c5a03946d97fafe79ad71793d08d8a3d0095bc8","observation_id":"a7a7a505-b829-4e90-9f55-e476e8698b32","resolution":{"observed_at":"2026-08-01T04:30:11.681602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-04T17:23:16.244130Z","title":"arXiv preprint arXiv:2306.17107 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01979","last_updated":"2026-08-03T09:42:34Z","snapshot_observed_at":"2026-08-09T11:30:20.131465Z","submitted_at":"2026-08-03T09:42:34Z","title":"ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T17:23:16.244130Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2608.01979"},"observation_digest":"sha256:2e7664797370d82a9d3c70db9e7826107c95c2f179533d585c188796a5b683a2","observation_id":"af204b94-4cd4-4e3f-91de-fc9cdbedc8e3","resolution":{"observed_at":"2026-08-04T17:23:16.244130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-08T17:13:26.039380Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding.arXiv preprint arXiv:2306.17107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05249","last_updated":"2026-08-07T01:16:18Z","snapshot_observed_at":"2026-08-10T07:09:39.830480Z","submitted_at":"2026-08-05T15:55:15Z","title":"PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T17:13:26.039380Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2608.05249"},"observation_digest":"sha256:35b9accbd58df975c430d8db6957cd45f8e1efc76c14b17a1bf24c72649f93a2","observation_id":"7cab4f00-62f7-40d1-9b1f-c814d20e9488","resolution":{"observed_at":"2026-08-08T17:13:26.039380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-10T04:31:25.742591Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding.arXiv preprint arXiv:2306.17107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05249","last_updated":"2026-08-07T01:16:18Z","snapshot_observed_at":"2026-08-10T07:09:39.830480Z","submitted_at":"2026-08-05T15:55:15Z","title":"PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T04:31:25.742591Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2608.05249"},"observation_digest":"sha256:5fd914fae37907b36f55b0ba2673ef4bc0cd9aeb6736a6c4073942794c6e5462","observation_id":"ab0e55c6-3e45-4a69-9009-aa821fee3ac0","resolution":{"observed_at":"2026-08-10T04:31:25.742591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.17107/citation-record","integrity":"/paper/2306.17107/integrity","json":"/paper/2306.17107/citation-record.json","paper":"/paper/2306.17107"},"outbound":[],"paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2306.17107."}