{"as_of":"2026-08-10T07:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5449eb52732689fdfdc55f08724a2dbe5e64a01098258af47aefb4e4e6c8d6c6","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:20:02.961462Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.06814/citation-record","integrity":"/paper/2502.06814/integrity","json":"/paper/2502.06814/citation-record.json","paper":"/paper/2502.06814"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-08-10T07:18:38.528911Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-09T11:20:02.827545Z","title":"and Zuidema, W","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.827545Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:9c1dbc3086ddeac33793d61e785b4de02cf2b829ef9a74fcf1c70bb5a1b451ba","observation_id":"d338fb1d-b675-43e3-9579-d667c57762b9","resolution":{"observed_at":"2026-08-09T11:20:02.827545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:20:03.484735Z","title":null,"venue":null,"work_id":"62ca5044-4114-4416-b73f-7b9dfaa49f93","year":2024},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.954871Z"},"links":{"citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:4eaeb200b861fa9d74f1bf48d2e211ebe23375475970a21315aea3b915c1e12f","observation_id":"006e4a96-c10a-43d1-a547-73b0e193cf74","resolution":{"observed_at":"2026-08-09T11:20:03.487975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-09T11:20:02.839886Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.839886Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:14ba09505eaa061959b7a3c62dc4a23a47ef398760778e4148770620ccb07c8a","observation_id":"753a6847-e0fb-4ca6-bff8-6e4114a0a820","resolution":{"observed_at":"2026-08-09T11:20:02.839886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11087","last_updated":"2025-03-04T03:19:20Z","snapshot_observed_at":"2026-08-03T17:53:41.286426Z","submitted_at":"2024-10-14T21:01:01Z","title":"Locality Alignment Improves Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11087","snapshot_observed_at":"2026-08-09T11:20:02.847466Z","title":"Locality align- ment improves vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.847466Z"},"links":{"cited_paper":"/paper/2410.11087","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:b75af76dfdcc7569fddff1c9e7a61e5da3cee03664a12a5a85b254bb349cafff","observation_id":"d3e91e9b-6ceb-4084-807e-582139deaa96","resolution":{"observed_at":"2026-08-09T11:20:02.847466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-09T11:20:02.851199Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.851199Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:8544deacadcefb85607f2e33f0e9e1b56d73b87006b321496edaa722b38108c8","observation_id":"97079387-3cba-4818-9ce4-1de22dc43b31","resolution":{"observed_at":"2026-08-09T11:20:02.851199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-09T11:20:02.854961Z","title":"Deitke, M., Clark, C., Lee, S., Tripathi, R., Yang, Y ., Park, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.854961Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:b26a2396f5c8899eed03c9887be04a24749d8500d6d6706acfd0126a3c64bde9","observation_id":"fd0b7c91-341b-4bd7-b841-e62f05ec2dd8","resolution":{"observed_at":"2026-08-09T11:20:02.854961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T11:20:02.858643Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.858643Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:467b486e81c59886a34a4515c83ee9f3aeb561e41ae7546007ce635f7c1fa27c","observation_id":"bd5dadf8-0c1c-4964-91ca-f7ea139c9adb","resolution":{"observed_at":"2026-08-09T11:20:02.858643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T11:20:02.861920Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.861920Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:7ddc11e17971cea8159de31f11ff048845187baf11f7303419414d7fc8007f4a","observation_id":"86928694-8f44-4b8e-8ac7-171e879ad086","resolution":{"observed_at":"2026-08-09T11:20:02.861920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-09T11:20:02.865354Z","title":"MME: A com- prehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.865354Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:b0c084d0d87cbacc6e10e20940bf84cff5394b9977251aff49d099980bc3933e","observation_id":"5da7329e-dcb0-4ae5-ab1c-9af495ef7fb5","resolution":{"observed_at":"2026-08-09T11:20:02.865354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-09T11:20:02.868705Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.868705Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:f2f7355cf31869b1c1b15420a05b023426baa7e6d097c4c1877abcc69c2f9744","observation_id":"2ec41dfa-e504-4b23-810b-c228404d5359","resolution":{"observed_at":"2026-08-09T11:20:02.868705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12274","last_updated":"2024-05-25T00:01:46Z","snapshot_observed_at":"2026-07-06T16:35:19.728025Z","submitted_at":"2023-10-18T19:18:19Z","title":"An Image is Worth Multiple Words: Discovering Object Level Concepts using Multi-Concept Prompt Learning","version":2},"cited_work":{"arxiv_id":"2310.12274","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.12274","snapshot_observed_at":"2026-08-09T11:20:03.322477Z","title":"An Image is Worth Multiple Words: Discovering Object Level Concepts using Multi-Concept Prompt Learning","venue":"cs.CV","work_id":"85dce825-3cd1-4eb8-873d-186f9276e196","year":2023},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.878657Z"},"links":{"cited_paper":"/paper/2310.12274","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:e59c422228b6795c9aee19668450bde89b922d75f0b1a945dd811f78363046e2","observation_id":"d4cde6a4-3798-4820-b931-7571094cf985","resolution":{"observed_at":"2026-08-09T11:20:03.328169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:20:03.474875Z","title":"Yes I’m not able to provide a name for the person in this picture","venue":null,"work_id":"ede0f8be-43b4-4d21-97c2-246747d99596","year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.958257Z"},"links":{"citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:ea26df8a0b867d5f0c487cefc872e88fe58c3e96f7ba5acba6d9e1cde75fecfb","observation_id":"ce78c41b-9411-4a30-9193-69c056eb575f","resolution":{"observed_at":"2026-08-09T11:20:03.478271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:20:03.510006Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"894a2871-61f2-49ed-8e4f-787724e033e3","year":2016},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.885151Z"},"links":{"citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:37ffbfe9e1fe6a617aca4401cb1b3bd7023ed04cffb563f7302c35eb0f7c7638","observation_id":"29ba56bc-ad06-4e2f-9a4f-2abd4030c8c3","resolution":{"observed_at":"2026-08-09T11:20:03.513418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-09T11:20:02.888308Z","title":"Seed-Bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.888308Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:2e7ed0f5a7e049001ebe64a2edbd898d2de554ce0dd39278a3c76440bb8674aa","observation_id":"8cef1745-d6ec-4c29-8da3-e693cbf9c072","resolution":{"observed_at":"2026-08-09T11:20:02.888308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-09T11:20:02.895321Z","title":"HallusionBench: You see what you think? or you think what you see? an image-context reasoning benchmark challenging for gpt-4v (ision), llava-1.5, and other multi-modality models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.895321Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:ab38dd73791f69a67864efb205d36d29132719ef6478434a81ef82a2b080f849","observation_id":"8ea88340-2eda-4ee4-b965-2c0c86a1074c","resolution":{"observed_at":"2026-08-09T11:20:02.895321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12722","last_updated":"2024-10-16T16:31:24Z","snapshot_observed_at":"2026-07-06T19:34:41.712266Z","submitted_at":"2024-10-16T16:31:24Z","title":"WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12722","snapshot_observed_at":"2026-08-09T11:20:02.902422Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.902422Z"},"links":{"cited_paper":"/paper/2410.12722","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:bda59cee48f1b8815f0a09ba7d8c332eb1fcc27b5e2cde635fda140605f7fbb7","observation_id":"05b1e9d4-cfdb-4221-b7d0-83d0c64e4274","resolution":{"observed_at":"2026-08-09T11:20:02.902422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:20:02.905887Z","title":"K., and Chakraborty, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.905887Z"},"links":{"citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:74ee882e7efd4b2f1defd715885c2ab81f178ac8a3da8519ef7864b344f2ae84","observation_id":"36a53c59-dd2e-4c85-a3f2-2498162596d4","resolution":{"observed_at":"2026-08-09T11:20:02.905887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09794","last_updated":"2022-11-17T18:58:14Z","snapshot_observed_at":"2026-08-04T20:45:04.370492Z","submitted_at":"2022-11-17T18:58:14Z","title":"Null-text Inversion for Editing Real Images using Guided Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09794","snapshot_observed_at":"2026-08-09T11:20:02.909198Z","title":"org/abs/2211.09794","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.909198Z"},"links":{"cited_paper":"/paper/2211.09794","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:4d13105e10387c6204d967e354df6d9a5b40adafab27eea455f9d68d62b68aa7","observation_id":"dedd01ec-d94b-4eb1-82aa-2a9b642f4438","resolution":{"observed_at":"2026-08-09T11:20:02.909198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-07-06T19:07:16.252072Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-09T11:20:02.912656Z","title":"Eagle: Exploring the design space for multi- modal llms with mixture of encoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.912656Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:6d8b724068662d064cc0300355fae674e436c7994362c7323a39d82b131b5304","observation_id":"533938b4-b2bb-4b3a-bd32-4cf798a355d5","resolution":{"observed_at":"2026-08-09T11:20:02.912656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-09T11:20:02.915960Z","title":"Singh, A., Natarajan, V ., Shah, M., Jiang, Y ., Chen, X., Batra, D., Parikh, D., and Rohrbach, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.915960Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:026da7f09be4a08274d82bdffb202f49c6d2f2160d8edb599a4f6e0dc35ff08c","observation_id":"ee30dcd7-c7ae-46b0-88c6-2244f47e3098","resolution":{"observed_at":"2026-08-09T11:20:02.915960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-09T11:20:02.920209Z","title":"Gemini 1.5: Unlocking multimodal understand- ing across millions of tokens of context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.920209Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:cc0faa46d92f61c49e18e2e4797e6b38e012e62a24602980719dbfb330fb7bfc","observation_id":"98d4ebac-f61e-41de-8b99-dea333610fa5","resolution":{"observed_at":"2026-08-09T11:20:02.920209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-09T11:20:02.923770Z","title":"C., Yang, J., Yang, S., Iyer, A., Pan, X., Wang, A., Fergus, R., LeCun, Y ., and Xie, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.923770Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:b0ab1d563e739b838fc765b15bccccf26c55b0569aef70afecea2db310654025","observation_id":"4eb3cb22-1e42-4136-b9b9-fa8ed3b8d626","resolution":{"observed_at":"2026-08-09T11:20:02.923770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-09T11:20:02.930797Z","title":"Minicpm-v: A gpt- 4v level mllm on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.930797Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:46bde54e1ba0598bff178e7d5bb678d9a40e7f2eb84b43f318dd1dd7515e7164","observation_id":"831adb08-f292-4032-9ce2-52ce6f47f6c8","resolution":{"observed_at":"2026-08-09T11:20:02.930797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-09T11:20:02.934093Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.934093Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:24dea05dddb3b866d4195f5533fdbc46bf9a4ffdc033339788a122305b64af8f","observation_id":"93323bd5-84d2-4465-a886-e599e250c5b5","resolution":{"observed_at":"2026-08-09T11:20:02.934093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-09T11:20:02.940685Z","title":"Transfusion: Predict the next token and dif- fuse images with one multi-modal model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.940685Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:8ed3babbeb4a762c7523cce136cf5fd943e22f3c090e48e502b31ef219e10159","observation_id":"fdcb8bb8-c620-4063-b910-8d2c30a36e4f","resolution":{"observed_at":"2026-08-09T11:20:02.940685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-09T11:20:02.944165Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.944165Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:7a310daf23a6befad296bd1718ccd1b6d50c1ee17440f443ec49c9e98b53d4e6","observation_id":"9b2dabd3-6c42-4bed-840f-89c5436cf7a0","resolution":{"observed_at":"2026-08-09T11:20:02.944165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13046","last_updated":"2024-10-31T17:39:34Z","snapshot_observed_at":"2026-08-05T02:05:40.291312Z","submitted_at":"2024-04-19T17:59:48Z","title":"MoVA: Adapting Mixture of Vision Experts to Multimodal Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13046","snapshot_observed_at":"2026-08-09T11:20:02.947795Z","title":"Mova: Adapting mixture of vision experts to multimodal context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.947795Z"},"links":{"cited_paper":"/paper/2404.13046","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:b04be65060ab457db257229cd95e398fef72486b3c2240fbf2d2251d60b0200f","observation_id":"282b4b10-ff46-44ee-934c-395677431439","resolution":{"observed_at":"2026-08-09T11:20:02.947795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:20:03.464667Z","title":"Lavender-Llama3.2-11B occasionally refuses to answer questions for privacy reasons, resulting in a FALSE score and reduced performance on MME as shown in Figure","venue":null,"work_id":"37b92539-77c9-4b76-a127-e3809005d1ae","year":2023},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.961462Z"},"links":{"citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:3b22ca9696c9b37bd2d96e52cb765e683cf8e494859ac352b2e253424803dc6e","observation_id":"083baf5f-7022-403b-8cd9-cfb287ed4f02","resolution":{"observed_at":"2026-08-09T11:20:03.468256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:20:02.937592Z","title":"Rlaif-v: Aligning mllms through open-source ai feed- back for super gpt-4v trustworthiness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.937592Z"},"links":{"citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:f208ae13b728f16be37d50680c148107aca6ba32729c59dddf677e8ddc9b864b","observation_id":"94208058-f678-4688-94a6-7e46de1a8519","resolution":{"observed_at":"2026-08-09T11:20:02.937592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-09T11:20:02.843537Z","title":"Janus-pro: Unified multimodal understand- ing and generation with data and model scaling, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.843537Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:77faf177342d8a72f8f71e54991dcf8a787d49b8119e958c90127f01a2fd6b30","observation_id":"ae997530-f339-4175-a6d3-29970b2e5456","resolution":{"observed_at":"2026-08-09T11:20:02.843537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-09T11:20:02.927306Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.927306Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:fc639d49928a0cd80768369f37742d9da453b385aaada044bbab72b420653c8f","observation_id":"1dcd946e-6b12-49be-819c-8c930699e662","resolution":{"observed_at":"2026-08-09T11:20:02.927306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11262","last_updated":"2024-10-02T22:33:08Z","snapshot_observed_at":"2026-07-06T18:31:57.866202Z","submitted_at":"2024-06-17T07:06:58Z","title":"Generative Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2406.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11262","snapshot_observed_at":"2026-08-09T11:20:03.347406Z","title":"Generative Visual Instruction Tuning","venue":"cs.CV","work_id":"4889978e-85cf-4d6b-a198-bf055564c162","year":2024},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.871867Z"},"links":{"cited_paper":"/paper/2406.11262","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:fc51e2eebfd259479c65a3688c102f31ae170795f174f89fe34a7e9e1807ff1f","observation_id":"1e2c2531-220b-4ead-ad40-fabf444c2d55","resolution":{"observed_at":"2026-08-09T11:20:03.351075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-09T11:20:02.898927Z","title":"X., Tan, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.898927Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:9d0f3eba69bf33cfc23d3202a26138194cb1d11393dd86460f8699a783ad7e3a","observation_id":"9f27da9b-4f64-418e-8d25-7da08b19e408","resolution":{"observed_at":"2026-08-09T11:20:02.898927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:20:03.494424Z","title":null,"venue":null,"work_id":"72b0f5f9-291a-425d-af5c-d7d7a462b299","year":2024},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.951042Z"},"links":{"citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:cffb0aa2872d9cf5ecb9292edfebd7e91aadc434e20077371d9c5c5908233c66","observation_id":"f44f9665-ad84-49ad-a442-55c9e4ea713b","resolution":{"observed_at":"2026-08-09T11:20:03.497726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-07T23:37:32.488201Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-09T11:20:02.875384Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.875384Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:3279fe44b27188d846c3a30755d5f6157d11e8e8dc591404e41161502479e920","observation_id":"c7b5b60e-23e2-47cf-953a-30ef807b3ed0","resolution":{"observed_at":"2026-08-09T11:20:02.875384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-09T11:20:02.891980Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.891980Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:21cfcfa4f96eef8924d8b41fb0a70a6fab3567e1f9b8f3c19f53981fc3c825ad","observation_id":"887f7ad3-bf50-4b40-a7bc-c69fb48be241","resolution":{"observed_at":"2026-08-09T11:20:02.891980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T11:20:02.836120Z","title":"Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.836120Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:140ed44822f85998464f140835a48ec608a604a849f329f26028a7a67e699aff","observation_id":"a4ca4871-c7c3-4e9d-bf23-56ed5f6ce608","resolution":{"observed_at":"2026-08-09T11:20:02.836120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-09T11:20:02.832217Z","title":"Alayrac, J.-B., Donahue, J., Luc, P., Miech, A., Barr, I., Hasson, Y ., Lenc, K., Mensch, A., Millican, K., Reynolds, M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.832217Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:ad6a094335073a263cd178edc4afef03647e6423faa6c2d1670d1465716591fd","observation_id":"02df6427-1317-4c79-bb21-8109ec65a7bd","resolution":{"observed_at":"2026-08-09T11:20:02.832217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-05T12:05:09.343843Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-08-09T11:20:02.881929Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.881929Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:c983c755f4272e156ad20899438a5e17f136f82fe52554ef023c2b6a08c06985","observation_id":"dae22de9-8599-466a-b913-24ff7e4a6a9d","resolution":{"observed_at":"2026-08-09T11:20:02.881929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2502.06814."}