{"as_of":"2026-08-10T05:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd8351dfb0b6695a72b33896f6eb3e8426e1ff2c8f9bfa7654574c6fa0c1f2d3","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:37:54.579360Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18115/citation-record","integrity":"/paper/2505.18115/integrity","json":"/paper/2505.18115/citation-record.json","paper":"/paper/2505.18115"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:46.891987Z","title":"anthropic.com/news/claude-3-family, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.891987Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:194a1004919ecb9c649edfa574fed92580646afd9fb56795506d86005668c9d4","observation_id":"46b57075-b50b-4e2b-8eda-d6c7d4a00491","resolution":{"observed_at":"2026-08-07T14:37:46.891987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T14:37:46.984855Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.984855Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:31ef110c8097ab9289c520d3329ef3700de9ab3287f032d0af52949c302d50b2","observation_id":"782c97b6-a0ee-48a1-98b5-ddaddf9a3ffe","resolution":{"observed_at":"2026-08-07T14:37:46.984855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.057781Z","title":"Easyocr: Ready-to-use ocr with 80+ supported languages, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.057781Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:52cbac08abdd7e28c351c3a63378227c1ad68d2d00b2fbd38141f557c4330741","observation_id":"104d0814-623d-4e48-b819-5e760535fa89","resolution":{"observed_at":"2026-08-07T14:37:47.057781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T14:37:47.145455Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.145455Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:d527fb5e223b32ecaf5c3f45aa16300bf968b2a3376367ef165c85a891932447","observation_id":"796be892-b44a-4377-ac8d-ab004995c347","resolution":{"observed_at":"2026-08-07T14:37:47.145455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.204766Z","title":"Visual instruction tuning with polite flamingo, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.204766Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:d1c69dfaf64015c6db0575f92c01a10418760964ce62b64a64997202cf979dca","observation_id":"651eafbd-c59b-4130-9934-46bd7538a63c","resolution":{"observed_at":"2026-08-07T14:37:47.204766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-03T10:34:58.776935Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-07T14:37:47.318544Z","title":"X-llm: Bootstrapping ad- vanced large language models by treating multi-modalities as foreign languages.arXiv preprint arXiv:2305.04160, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.318544Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:6ba5a04547d0c1720e33807a5662bcd6ca2f6b6ebddb86da1f3a92e4752c6ca5","observation_id":"c831eee2-e73b-417e-9027-f3269ee61fb9","resolution":{"observed_at":"2026-08-07T14:37:47.318544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-07T14:37:47.428346Z","title":"Allava: Harness- ing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.428346Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b40c5f741aa1b2d8a5f8378acfe8f471d59dc63339689b780c89382e644ff2b2","observation_id":"5cb8c7c1-401d-412e-8e3e-0e7c97190d55","resolution":{"observed_at":"2026-08-07T14:37:47.428346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.525458Z","title":"A spatial-temporal attention- based method and a new dataset for remote sensing image change detection.Remote Sensing, 12(10), 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.525458Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:5216f0447848d3261839f406d65da1d3524120ce4df0d97baf594ebf9d3b82eb","observation_id":"b95a4dfe-e21a-45e8-b711-6b0a9c66063b","resolution":{"observed_at":"2026-08-07T14:37:47.525458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T14:37:47.643807Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.643807Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:dcc53406ed16d747646ecc8248539b10266c83e39214cc96b4f831f5118d4b32","observation_id":"bd16a6c8-3983-407a-bbbc-0a74463d333d","resolution":{"observed_at":"2026-08-07T14:37:47.643807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T14:37:47.747310Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.747310Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:669fae8ae854fc6f6263ea24102a817b8f8af1e658e379332ebf2af700a8f04e","observation_id":"b005e4b9-97e1-43e2-939f-20470ea8ce43","resolution":{"observed_at":"2026-08-07T14:37:47.747310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.869048Z","title":"Lawrence Zit- nick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.869048Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:e9b9d36e44dad63a0e51eb712805f7ce7b1c64676b117f5468435e251a0355be","observation_id":"f9834eef-a3de-46c0-862d-9ffd3fdb35b8","resolution":{"observed_at":"2026-08-07T14:37:47.869048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T14:37:47.991699Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.991699Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:803e3e52a0daa806c24387b737f45ee4ade8a24dc4a3d73243100d4ebe7b0969","observation_id":"9996ac57-7c7b-4b9a-87ba-f060f5621bb1","resolution":{"observed_at":"2026-08-07T14:37:47.991699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T14:37:48.067033Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv preprint arXiv:2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.067033Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b324420de2715d484bace79bb0a6e0a51b4fac844f7c8c5ce05c5acd38b7197e","observation_id":"2099f931-f9a5-4ddb-ad83-46088d849220","resolution":{"observed_at":"2026-08-07T14:37:48.067033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.157821Z","title":"InstructBLIP: Towards General-purpose Vision- Language Models with Instruction Tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.157821Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:1c701da43c442be66d8d6d394176e394cb5b0fc1993d9d96ac26c2afa79d5d7f","observation_id":"f14b0b32-e92c-413b-97d5-96e04a4e1db4","resolution":{"observed_at":"2026-08-07T14:37:48.157821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T14:37:48.256692Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.256692Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:350ebe69415d70f9087305f864a49701ad7900bef8bf6a3f24b1adc7f44f4832","observation_id":"60b60378-128d-4a51-bfab-a54d8ec06a15","resolution":{"observed_at":"2026-08-07T14:37:48.256692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17453","last_updated":"2024-10-31T23:23:22Z","snapshot_observed_at":"2026-07-06T18:51:23.832577Z","submitted_at":"2024-07-24T17:37:05Z","title":"VILA$^2$: VILA Augmented VILA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17453","snapshot_observed_at":"2026-08-07T14:37:48.380183Z","title":"Vila 2: Vila augmented vila.arXiv preprint arXiv:2407.17453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.380183Z"},"links":{"cited_paper":"/paper/2407.17453","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:18cbe6d934cadb2a1afc1e2ef04a368fae1f4afea78972fda509acf049d7b78c","observation_id":"5b0978de-f67e-4d56-95cc-d7f8b6cb2cb6","resolution":{"observed_at":"2026-08-07T14:37:48.380183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-07T14:37:48.490128Z","title":"Llama-adapter v2: Parameter-efficient vi- sual instruction model.arXiv preprint arXiv:2304.15010,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.490128Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:ec673a51bb5eb2e6c9f472d1f73f82f9c3dade2713784b61c2dbd43d55fab75a","observation_id":"d7ecdb0d-2492-49a6-a8cc-52313f9dbd76","resolution":{"observed_at":"2026-08-07T14:37:48.490128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-07T14:37:48.592607Z","title":"Multimodal-gpt: A vision and lan- guage model for dialogue with humans.arXiv preprint arXiv:2305.04790, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.592607Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:1615ee9fb8c1682c5772b21f3f6de3fa096cf3fe3722edfacaefa293a1267b2a","observation_id":"b6714ece-d05d-4107-9b94-f2872aac866a","resolution":{"observed_at":"2026-08-07T14:37:48.592607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.728782Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.728782Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:c1b3e94f4d672aa7c30a35dd0de6ff0bf92b026f2a514e4f0c259883aa220e9f","observation_id":"5f0a3843-0cf2-4425-99ad-8c4993c74386","resolution":{"observed_at":"2026-08-07T14:37:48.728782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.817491Z","title":"Lvis: A dataset for large vocabulary instance segmentation, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.817491Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:140f8d4ebb260de34e3c0066427e0c47043f9c3cfc55347d648153346b4f7652","observation_id":"67454761-f5da-407e-a1de-f6713a34c68e","resolution":{"observed_at":"2026-08-07T14:37:48.817491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.902463Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.902463Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:dd0d42b0bfdaa121ab0e076d7e2936e907ff18005d04d9c74b1bdfc4bd95dc23","observation_id":"fcce6116-1ad7-4ac3-ab54-2bfeac289962","resolution":{"observed_at":"2026-08-07T14:37:48.902463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:49.015592Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.015592Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:f10ca6ff599fdfd321bfbda75f9142e76c94b348fb6b0e885c2786e0a4a9188b","observation_id":"138539a2-acc1-45ab-ac6e-ffe5b680a44d","resolution":{"observed_at":"2026-08-07T14:37:49.015592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:00.080822Z","title":"A hierarchical approach for generating descriptive image paragraphs, 2017","venue":null,"work_id":"68396fbf-9311-4386-8882-96e59aa8459d","year":2017},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.108696Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:04f28cb8b8a77f5150d67d658f25cdb8a88c0c5cf9e5f79331dd2bcfe5838686","observation_id":"1701edd4-247a-4a7e-8207-88461434a3e7","resolution":{"observed_at":"2026-08-07T14:38:00.174744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.963170Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":"6c700d00-ddb3-4a42-973d-ba78a0216a85","year":2017},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.174900Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:dce7a9533fc5c3b4062b432b9b85f4b2eb7ce7480f69d765670d96edb075ce56","observation_id":"52b62b25-d5d4-4d13-9baf-7587316d19f3","resolution":{"observed_at":"2026-08-07T14:38:00.001617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T14:37:49.240559Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.240559Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:92f3fa86f7609f29ff68d1a9987cb204ab3882547d3a47d6bfd9a3d854780813","observation_id":"be1b42e2-5ddb-4079-abfe-66c8fdcd20f3","resolution":{"observed_at":"2026-08-07T14:37:49.240559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:37:49.346808Z","title":"LLaV A-OneVision: Easy Visual Task Trans- fer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.346808Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:6c6e88efca2f88d3f2f218ee5bfd56af59e929a6e27149c705aae79e34dc8005","observation_id":"371ba48b-ccb0-4cbe-afbe-c7981a230f11","resolution":{"observed_at":"2026-08-07T14:37:49.346808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.847377Z","title":"Llava-med: Training a large language- and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"6096d3f1-f199-467b-bc1f-b5089a0a256a","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.455236Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:c7a19deb61edcdc53a8f95b802e27edb71c00030013152c8e4f13553e07be06d","observation_id":"a77ebe23-372f-4444-aed5-cd0fa947b70b","resolution":{"observed_at":"2026-08-07T14:37:59.903935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T14:37:49.502166Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models.arXiv preprint arXiv:2301.12597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.502166Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:8120004b85c07e5238378efe93b645d91a320f760c01306941ae29c291031bc3","observation_id":"a8c558c5-a72f-45e9-a9d7-1f7ebbe0173a","resolution":{"observed_at":"2026-08-07T14:37:49.502166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T14:37:49.563235Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.563235Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:ccc31834870b460aa8578bb55fb1d6270fe0db0417ab4e4c7983bdf03a98888b","observation_id":"faaad85f-8620-4213-b570-1c8ea8c4ffc9","resolution":{"observed_at":"2026-08-07T14:37:49.563235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-07T14:37:49.620424Z","title":"M3it: A large-scale dataset towards multi- modal multilingual instruction tuning.arXiv preprint arXiv:2306.04387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.620424Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b988b1c98215748aba56f00cd6081a9c8ea0f482f13145a6568e7772ecff6f0d","observation_id":"14856309-26db-41ac-9566-3a4537ffc053","resolution":{"observed_at":"2026-08-07T14:37:49.620424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.725780Z","title":"Vqa-e: Explaining, elaborating, and enhancing your answers for visual questions, 2018","venue":null,"work_id":"10d37a5f-7d55-474b-86f0-bee82f338fab","year":2018},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.686490Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:4f682ea898b801032b1d05e00142961dca400e901dd0b58e4a77099e38a05947","observation_id":"c585b79d-269e-4c02-9308-fcf74de76a1e","resolution":{"observed_at":"2026-08-07T14:37:59.790604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T14:37:49.747886Z","title":"Evaluating object hallucina- tion in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.747886Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:01d6092e38b33ad7b1b8202fae2d15a0133f09680e93968ab5cd5c2a94d4b0ef","observation_id":"94969b14-d44d-47c2-8861-5070f20e3530","resolution":{"observed_at":"2026-08-07T14:37:49.747886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.603058Z","title":"Visual spatial reasoning, 2023","venue":null,"work_id":"00cf1e7e-091e-4c25-8bd4-8e196d69f78c","year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.838964Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:0df312a767807b1da908d50aaa53b39e85c04051f5fb39ef8f0bd17218ce0d9b","observation_id":"7c0382da-693a-4f3a-9776-458f24d0c6e3","resolution":{"observed_at":"2026-08-07T14:37:59.666472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.473741Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"8ae094b4-0d5c-4f25-bf35-0a5bfe1ed9cb","year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.905071Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:7f883976fd035d8f6f0328b3ace36c477f8d32580473199082909b89807237d1","observation_id":"cab813d8-41d8-4017-b08c-62601713ff13","resolution":{"observed_at":"2026-08-07T14:37:59.545183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.346820Z","title":"Re- moteclip: A vision language foundation model for remote sensing, 2024","venue":null,"work_id":"b577bf2c-3aa4-490f-b33c-08cecd707f9c","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.020164Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:d30399f995ae08f29701ac5f83db2d16451c6475b79261095381cd7096e37a04","observation_id":"215f9bce-d532-40d2-9738-92b79cd9c2c3","resolution":{"observed_at":"2026-08-07T14:37:59.390252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T14:37:50.139418Z","title":"LLaV A-Next (LLaV A 1.6).arXiv:2310.03744, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.139418Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:0ba9fc0c1c6f5e855d543c0b67a3673efd9cd3a5a7a009527e441b9cc4754bc5","observation_id":"7d2fbc4c-7672-43e1-8e6d-30159bf48853","resolution":{"observed_at":"2026-08-07T14:37:50.139418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.204389Z","title":"Visual Instruction Tuning","venue":null,"work_id":"4fc407ea-8192-40c0-8e7a-810511c9e5ee","year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.191652Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:787943e8d5b087c2d1207527bf12aae6171c67631a88cb3184d7dc09c7254a4a","observation_id":"e31ce97b-c664-4210-859c-2a0a52e2a0a3","resolution":{"observed_at":"2026-08-07T14:37:59.264947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-07T14:37:50.260198Z","title":"On the hidden mystery of ocr in large multimodal models.arXiv preprint arXiv:2305.07895, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.260198Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:c37e95c3d6815e57392a50bcf4d09cf6bd0f21a1344297526cf1492c008f8784","observation_id":"06f694ee-ae57-43f3-9b51-af7dfbf81379","resolution":{"observed_at":"2026-08-07T14:37:50.260198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.359568Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.359568Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:07ef4e440410bb0ce7c165d3d892292dca2dbfab4f04b263bae014ea6f1c2b0c","observation_id":"ef8d6850-20a7-4319-ab31-b52b2775110e","resolution":{"observed_at":"2026-08-07T14:37:50.359568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:59.075559Z","title":"Cheap and quick: Efficient vision- language instruction tuning for large language models.Ad- vances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"c4303bb5-ddee-45b2-872b-f6768fcfde29","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.416318Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:1144b76aced42fdf7b421788ecf450a73612c57975ebc489c98efcd680e18cf4","observation_id":"1677e10a-078b-4e21-a9f7-49a49750125d","resolution":{"observed_at":"2026-08-07T14:37:59.127343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.937143Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"e918ccfb-2176-4379-8af3-13c95911e3fe","year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.498036Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b537e2b01eed54a42700b4b6d5a82a5549defd5048157b70ab9e01a1d809d8b7","observation_id":"ca9547b3-7859-44f6-81e2-abd7d2890ecc","resolution":{"observed_at":"2026-08-07T14:37:59.000551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.832198Z","title":"ChartQA: A benchmark for question answer- ing about charts with visual and logical reasoning","venue":null,"work_id":"4516e947-0160-4c2b-bcdb-c457318a2215","year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.601306Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:2cdb9b9a0b27210e5b52e4acc68793cdcc3a0e2fabb4d0cfb88b15bf256383d3","observation_id":"dd0db20d-f593-4607-8163-e0c6fdd3d277","resolution":{"observed_at":"2026-08-07T14:37:58.871384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.695132Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"3c3316c8-be54-4186-9cc0-0bc5e6a88606","year":2021},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.652514Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:4c24b9a08ef63070809f7fedd8bc63adc10ecf9b9c3644964842ecbfaab3c823","observation_id":"784ff458-d379-46e3-9ff8-67e5b2e9d52d","resolution":{"observed_at":"2026-08-07T14:37:58.756318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.569778Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"50594879-d3f3-4d2e-ab46-6c647f91ef16","year":2021},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.686865Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:9a689726307a05ff58198c8c70c7e343cb7cd057cd6d3bc00c717a9a0d3d2afb","observation_id":"d21ae786-c348-4a0a-a84f-33f36383efbd","resolution":{"observed_at":"2026-08-07T14:37:58.625510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.432515Z","title":"Infographicvqa","venue":null,"work_id":"12a4d1c6-fc5c-4089-9455-2b8eca0d8002","year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.750838Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b78db4f87d9186710ec70f5c2aa5bd65046a6717dc79946911c4b79f9844f0f1","observation_id":"06388035-1aea-42a3-be92-4b1475ccde45","resolution":{"observed_at":"2026-08-07T14:37:58.498770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.302810Z","title":"Introducing llama 3.1: Our most capable models to date, 2024","venue":null,"work_id":"3dcc9183-5b15-4c4b-a03f-8d2212db78a0","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.862393Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:77f1c44f1329dc6659a5df32252854a8dfdc5af6dff3a29ce5e6eb4337739703","observation_id":"4776cc86-5905-4a10-a79d-db2de8dde0bb","resolution":{"observed_at":"2026-08-07T14:37:58.357548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.182157Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"3a642c3e-4f69-44d2-bb1b-7cd158d1c5a2","year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.960826Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:6bce042eb2abc36493ae94dc91af19c9bd91970dd6bdfbe14b183b65f73de195","observation_id":"66ace162-e509-4286-86b4-c8dd4db39ea8","resolution":{"observed_at":"2026-08-07T14:37:58.243549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:37:51.068769Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.068769Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:0207f0b27c15250f0264c29d2b4f55c7ec99946700e32d09b4d07c10d6bb2dfe","observation_id":"a4a480c5-8733-4000-9d67-3dfc28e2529d","resolution":{"observed_at":"2026-08-07T14:37:51.068769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:58.034925Z","title":"Gpt-4 technical report.ArXiv, 2303:08774,","venue":null,"work_id":"09534709-ea9f-4657-90e1-23dc5955eda4","year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.149206Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:98875e4f65a0286c9d4193b36a0815f9dea1a49ef693043cf4f3dc58bc371bc9","observation_id":"7056f086-e554-422e-a905-bbf7d132200e","resolution":{"observed_at":"2026-08-07T14:37:58.096391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.862825Z","title":"Im2text: Describing images using 1 million captioned pho- tographs.Advances in neural information processing sys- tems, 24, 2011","venue":null,"work_id":"05a6b9ed-e4a2-47eb-8f96-4d7d87239e60","year":2011},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.239072Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:00078c3bc523a189ceadc8b22f78087165f490de9dd86121ba080ebbdbec15b1","observation_id":"5cae0bc2-df35-4cb3-a429-ba3d5a4969ae","resolution":{"observed_at":"2026-08-07T14:37:57.959041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.729269Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"39e08e46-184d-4a40-bc11-5c1d8b8bd33d","year":2015},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.305339Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:e73783728ab0787468469f5ddfc1b6c2a2a0d00d760cf02cda4d115e9a7f2325","observation_id":"54bf0e9f-0d87-4f8f-b08c-d3b7863163e0","resolution":{"observed_at":"2026-08-07T14:37:57.800017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.426771Z","title":"Connecting vision and lan- guage with localized narratives","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.426771Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:ea29f7073ad5c32f97b934891aee7929e3a18bec97507115bdf42a6ecfa565fe","observation_id":"cd0bd085-48de-4114-8338-4ecd557293d4","resolution":{"observed_at":"2026-08-07T14:37:51.426771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.563368Z","title":"Connecting vision and lan- guage with localized narratives, 2020","venue":null,"work_id":"37b15b96-2554-4ae4-8e27-3df4392fad6b","year":2020},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.548336Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:1f0b628f03e286a1d05599ea97c9cf61b0b0d52be3e98c3dcea2850a7e8cea20","observation_id":"f3b8d652-7b42-461e-b27b-47389529bc39","resolution":{"observed_at":"2026-08-07T14:37:57.640816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.388866Z","title":"Learning Transferable Visual Models from Natural Language Supervi- sion","venue":null,"work_id":"b775f4e4-525f-4207-bd2c-e89a202b0e50","year":2021},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.644142Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:5df34ac107b538c45dafc6d3ee6e06f1ee5e000bd91ed266bfdd142af7a9f4c0","observation_id":"8d661666-9ccd-4410-9e1f-88ff7c3cc442","resolution":{"observed_at":"2026-08-07T14:37:57.481113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.718046Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.718046Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:926097bfcf1cb543a109ad6dcf03bec9d672280f590eec469d011c59305d131d","observation_id":"91df7c65-2a47-41ee-8a80-046a9b9afc38","resolution":{"observed_at":"2026-08-07T14:37:51.718046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.214841Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models, 2022","venue":null,"work_id":"c0e4b739-41c2-49a1-afe2-4b1aae468198","year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.814560Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:964f3615b320a188aa4ee4c8899004a2f917ad49e37c705447ac83320ca934aa","observation_id":"ef1219ee-359e-4e0b-b56a-f987b3b47ed1","resolution":{"observed_at":"2026-08-07T14:37:57.268836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:57.043927Z","title":"LAION-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"6951e72d-8ee6-4224-8d86-07b962575074","year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.909444Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:85c81fe1435987afe825919c1091712860db45d4268ffb7d2a90ec0ebdd3cffb","observation_id":"d9436920-017a-44a7-afda-5d1af3ec8759","resolution":{"observed_at":"2026-08-07T14:37:57.125445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.887898Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge, 2022","venue":null,"work_id":"4d67c01b-3dc9-4f9a-b0c6-7c93a4b0f4f2","year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:51.987410Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:aa4e6c7674988f2b7e0d05dabf52c653c87aadd5b54092a3cabaf02184b2a3f7","observation_id":"90b898b8-7c71-46e2-95cb-1566aef7fb9e","resolution":{"observed_at":"2026-08-07T14:37:56.954674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:52.061066Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.061066Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:1959c7df45a7c44fda7e6e46618403e2b1193676a72e4d7d5b09cdf410ea055b","observation_id":"3356d403-ad9b-4824-8be7-6416ca85b22c","resolution":{"observed_at":"2026-08-07T14:37:52.061066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-08T00:41:26.316141Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-07T14:37:52.139069Z","title":"Math- llava: Bootstrapping mathematical reasoning for multimodal large language models.arXiv preprint arXiv:2406.17294,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.139069Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:821041712138909bdbf0e36a4aaa6f1162e604a8bd2a4afa5113491f6e2b01af","observation_id":"004772e0-2b2d-4d52-b3ea-10f23bce2144","resolution":{"observed_at":"2026-08-07T14:37:52.139069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.731667Z","title":"Textcaps: a dataset for image captioning with reading comprehension, 2020","venue":null,"work_id":"c66acc80-8f44-4ea1-8956-a2ad7178ae09","year":2020},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.225514Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:4b2692df15878ae4a9b7e53155a97f7d3f675eda307ceca1fa91e6700397a971","observation_id":"d92235de-80c8-4b4f-bef1-c0820066dc7c","resolution":{"observed_at":"2026-08-07T14:37:56.806437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.548743Z","title":"Towards vqa models that can read","venue":null,"work_id":"446d6f02-c8a8-4926-9872-dca948626513","year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.325073Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:48234ebe74e366ba626498bb1a0d9f42e5c6d60cd808fe9bc69835dc5341f4dc","observation_id":"a49b2bf3-6aba-4f4c-9b1c-21bc58b08f63","resolution":{"observed_at":"2026-08-07T14:37:56.621102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.411424Z","title":"Expressing visual relationships via language,","venue":null,"work_id":"9299bf94-849f-41d0-9422-c4c896cc8dbf","year":null},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.400976Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:97b774d7057581491d7013c3f2b4606bd48b69260269f13b235b5ea528978349","observation_id":"fa194d73-e61a-437c-90c9-b34f3b6187a6","resolution":{"observed_at":"2026-08-07T14:37:56.482837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.262714Z","title":"Vi- sualmrc: Machine reading comprehension on document im- ages, 2021","venue":null,"work_id":"339f7f95-1460-4559-9172-e8b70c8b3717","year":2021},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.451431Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:bd3d20dc272fe05c5067be97b8a3709322db2292573b0bdefee06f5ac922b68e","observation_id":"7869d6d7-f163-4c65-bb7d-4966d4508cb6","resolution":{"observed_at":"2026-08-07T14:37:56.336625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T14:37:52.521778Z","title":"Gemma 2: Improving open lan- guage models at a practical size, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.521778Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:07150d1b98e38698a84afb2e71c10e8402b42f1652f10280b0debd0eab509fc4","observation_id":"a922125a-d40a-42cd-88e0-b8e911720714","resolution":{"observed_at":"2026-08-07T14:37:52.521778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:37:52.582430Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.582430Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:60a142834bad3a0723fc755eacef662f9b5d88a84b1265e4bcabc64770b916b5","observation_id":"9c42d8e9-8075-4a81-9d7f-c781c5e161b8","resolution":{"observed_at":"2026-08-07T14:37:52.582430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T14:37:52.700977Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.700977Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:902cc7d792014811a7c115739447bab8f56eef0d2864b127dbb7a723ee12c1f2","observation_id":"38bf7cf7-0be6-46ee-b247-97608eee72ae","resolution":{"observed_at":"2026-08-07T14:37:52.700977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T14:37:52.789583Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.789583Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:74d4f930249b8c8ead53986ae7498d2fa8926d9ffaf5ad548fdaa6e832599c7b","observation_id":"380b9a90-ab99-4a3d-8c4d-52846bee1ac0","resolution":{"observed_at":"2026-08-07T14:37:52.789583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02677","last_updated":"2023-07-06T13:47:21Z","snapshot_observed_at":"2026-08-09T15:56:42.519342Z","submitted_at":"2023-05-04T09:48:22Z","title":"Caption Anything: Interactive Image Description with Diverse Multimodal Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02677","snapshot_observed_at":"2026-08-07T14:37:52.880552Z","title":"Caption anything: Interactive image description with diverse multi- modal controls.arXiv preprint arXiv:2305.02677, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.880552Z"},"links":{"cited_paper":"/paper/2305.02677","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:d572dc0069b92fcd362a9d4350305afd2fd4c55cb56031ab9673c4bae60e9685","observation_id":"3b1342ee-9a8c-49d0-a595-5350d486a591","resolution":{"observed_at":"2026-08-07T14:37:52.880552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:56.100257Z","title":"Visionllm: Large language model is also an open- ended decoder for vision-centric tasks.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"53ae7502-c744-4880-8299-14b68a5e567f","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:52.996429Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:d738b52a6d0571278b470ae44d27f2dd7bd39e5339a30b8d4a4ee109bc9d1238","observation_id":"198dbafe-e916-4c44-9197-d8817203973c","resolution":{"observed_at":"2026-08-07T14:37:56.167971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12067","snapshot_observed_at":"2026-08-07T14:37:53.072593Z","title":"Instructiongpt-4: A 200-instruction paradigm for fine-tuning minigpt-4.arXiv preprint arXiv:2308.12067, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.072593Z"},"links":{"cited_paper":"/paper/2308.12067","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:f756de30cfe365e01b6b9b793a278ee467650130feea64fb0e58027b99c1de0f","observation_id":"5b49823c-2299-4c5a-b696-a4f930bba88f","resolution":{"observed_at":"2026-08-07T14:37:53.072593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-09T09:24:00.370216Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-07T14:37:53.136267Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.136267Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:74a6b4b412c26a78317fad898fbd86d18875677351b7cb045a023417c5e93889","observation_id":"b4595a73-fa6a-4f5a-9acd-dace869b8128","resolution":{"observed_at":"2026-08-07T14:37:53.136267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.978899Z","title":"Grok-1.5 vision preview, 2024","venue":null,"work_id":"b2d59879-0986-4924-9011-06728f6ea13b","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.189797Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:1b3d5134cff09d24f790173400ebddf1e9a7f8c17c700e8ddd9ad1a0654ab37e","observation_id":"49d01f9d-7713-4b5f-be24-b4ddca4e6e66","resolution":{"observed_at":"2026-08-07T14:37:56.031446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10773","last_updated":"2023-06-10T18:33:21Z","snapshot_observed_at":"2026-07-06T14:33:20.852718Z","submitted_at":"2022-12-21T05:17:06Z","title":"MultiInstruct: Improving Multi-Modal Zero-Shot Learning via Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10773","snapshot_observed_at":"2026-08-07T14:37:53.282556Z","title":"Multiinstruct: Im- proving multi-modal zero-shot learning via instruction tun- ing.arXiv preprint arXiv:2212.10773, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.282556Z"},"links":{"cited_paper":"/paper/2212.10773","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:0b17672f47d692e0ccd8777ff84fee73b3d9c1a2a8db2a0c62ba4e3fa28ee6ce","observation_id":"7b2e6457-62fd-42fb-a0e8-3d9c75c8c7c7","resolution":{"observed_at":"2026-08-07T14:37:53.282556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:53.381001Z","title":"Depth any- thing v2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.381001Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:b5371414095961cc0d1815871b12d89401a58dd97ba77be9bfd1b49b679c3012","observation_id":"6942175e-fc92-4847-a539-083a5e111a60","resolution":{"observed_at":"2026-08-07T14:37:53.381001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-07T14:37:53.457998Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding.arXiv preprint arXiv:2307.02499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.457998Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:8d3a0a2b171be65d7e22687e250e0b3927433e75a815bbdad4e22f236b27a756","observation_id":"a3f2b3ba-ba36-44b4-85d1-72b640d28a8d","resolution":{"observed_at":"2026-08-07T14:37:53.457998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-07T14:37:53.547479Z","title":"mplug-owl: Modularization empowers large language models with multimodality.arXiv preprint arXiv:2304.14178, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.547479Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:fb0e6d6a73b671d20c9e8c896881d0e6671ec5a8b27fc44eed540157afc543d0","observation_id":"0e25ae2a-754a-4ccc-9765-bee5c3134768","resolution":{"observed_at":"2026-08-07T14:37:53.547479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.851769Z","title":"Berg, and Tamara L","venue":null,"work_id":"980524df-bb19-4e99-a980-12ddd174d58c","year":2016},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.643876Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:00b7a969c5d756a3e34d9e1f0310a5e0ffc9fdf2c8ae8e8bf161c6c0c3c482b2","observation_id":"5b4c1e2a-b493-4099-9e37-d7226f266c96","resolution":{"observed_at":"2026-08-07T14:37:55.940987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.732202Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"48274891-2b41-49ca-9f3f-d400cf2e7df5","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.717638Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:46c7b7cd69743666cd49c46dbf109e73ffb72d4155777037d3ff37d82e840097","observation_id":"adab7efc-a886-42f9-bb80-f7790886c47f","resolution":{"observed_at":"2026-08-07T14:37:55.792963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.614223Z","title":null,"venue":null,"work_id":"fbf66213-25fc-48ea-be0d-2c37f2506f68","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.805718Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:8d31f1af4f761e03259d5b321cdae6c9633e6dee873f70d1a94e1ed9a448f019","observation_id":"ab4b3daa-e6ad-49dc-927d-d3c5aa0b623d","resolution":{"observed_at":"2026-08-07T14:37:55.668988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.470876Z","title":"Rsvg: Exploring data and models for visual grounding on remote sensing data","venue":null,"work_id":"f4f326e0-4b3f-4d66-bf4b-4a76c3fa0d5e","year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.898696Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:2335ef68744bb92a618fda0d1e49c35e586c4a1f2c5fdcb73e75e0fce4930879","observation_id":"b03a1f4f-3d0b-4a85-9256-5af7f73046ce","resolution":{"observed_at":"2026-08-07T14:37:55.534422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.317495Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":"3a399544-2383-4867-97dc-7659eda0eeaf","year":2024},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:53.962404Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:2fce940e763ed395c4e7f681042ece8e05e94e666fe5cd1633f8188f065ebe18","observation_id":"a6a07919-ca3a-4726-933d-7a98911f55b3","resolution":{"observed_at":"2026-08-07T14:37:55.393162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-07T14:37:54.044923Z","title":"Internlm- xcomposer: A vision-language large model for advanced text-image comprehension and composition.arXiv preprint arXiv:2309.15112, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.044923Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:df455055bd0f249e1ebda54593a75ee95412de6e21e27f37c7f7164e6aa4813d","observation_id":"15480673-59f4-46b2-b0ea-d123ad922208","resolution":{"observed_at":"2026-08-07T14:37:54.044923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T14:37:54.116967Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention.arXiv preprint arXiv:2303.16199, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.116967Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:8fa36bc4d2f0b3dca4d2ba42292d2599ac26dd304aa2238092e951a8012cc669","observation_id":"d2f15a56-beea-495f-9df7-5032803d62a4","resolution":{"observed_at":"2026-08-07T14:37:54.116967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.166546Z","title":"Hierarchical and robust convolutional neural network for very high-resolution remote sensing object detection","venue":null,"work_id":"c513a9a6-6a38-4541-b3a6-3637c33fd4af","year":2019},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.194802Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:e1a6253d380201d9bc3f20308a0908352958c2ced1d41e8115105186290f7921","observation_id":"1253bd24-febe-40c5-a414-cd03f10b8c9b","resolution":{"observed_at":"2026-08-07T14:37:55.246086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T14:37:54.258922Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.258922Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:fc27693fcffb1d80470cec685261e2c85d9132244326f526a7036808f690528c","observation_id":"a346cf23-6cad-4a8b-867c-efcd33e76a44","resolution":{"observed_at":"2026-08-07T14:37:54.258922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-07T14:37:54.331667Z","title":"Svit: Scaling up visual instruction tuning.arXiv preprint arXiv:2307.04087, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.331667Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:f08fb880a3ad2753d1d19eaceb993b9be209963ccdb123d16a1ab6105cb4a1d8","observation_id":"05c6122e-8d8d-44a8-bd5b-e427e1374c22","resolution":{"observed_at":"2026-08-07T14:37:54.331667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16103","last_updated":"2023-05-25T14:34:08Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T14:34:08Z","title":"ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16103","snapshot_observed_at":"2026-08-07T14:37:54.397753Z","title":"Chatbridge: Bridging modalities with large language model as a language catalyst.arXiv preprint arXiv:2305.16103, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.397753Z"},"links":{"cited_paper":"/paper/2305.16103","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:5f0d2ae96eb2c51c37ce1ab1beb38a81de3a68468242d011e8cd67236eab4984","observation_id":"f40fa1de-f74d-43db-8c29-353c44361fce","resolution":{"observed_at":"2026-08-07T14:37:54.397753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:37:54.505962Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.505962Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:4af0617a94741ed836cc8a35126bde699d13304edf686405c769ba871d5a5d80","observation_id":"6619e153-8a2f-46be-a2bd-06e10ce65ca6","resolution":{"observed_at":"2026-08-07T14:37:54.505962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:55.000454Z","title":"Visual7w: Grounded question answering in images, 2016","venue":null,"work_id":"5914098e-c34d-42d7-8782-e34d24ff131c","year":2016},"citing_paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:54.579360Z"},"links":{"citing_paper":"/paper/2505.18115"},"observation_digest":"sha256:404dec146ddb76e275b8c9679746d30adb016985195c9bff759d0d0eb54e9dea","observation_id":"a5dbdd01-7047-4333-b9db-7191c179e2e4","resolution":{"observed_at":"2026-08-07T14:37:55.062673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18115","last_updated":"2025-05-23T17:14:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:41:58.877205Z","submitted_at":"2025-05-23T17:14:12Z","title":"Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2505.18115."}