{"as_of":"2026-08-15T21:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:33dc3457651fcab9cd1b91315e769a5cc04ad9a7d943729f33df067017c22a45","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:43:08.380678Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:32:48.356870Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T15:32:48.405652Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"cited_work":{"arxiv_id":"2412.16364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16364","snapshot_observed_at":"2026-08-10T15:32:48.405652Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","venue":"cs.CV","work_id":"1ef944a0-3f7e-4eb7-b5e3-665d453346a1","year":2024},"citing_paper":{"arxiv_id":"2501.13921","last_updated":"2025-02-11T16:48:15Z","snapshot_observed_at":"2026-08-15T05:20:40.055405Z","submitted_at":"2025-01-23T18:59:02Z","title":"The Breeze 2 Herd of Models: Traditional Chinese LLMs Based on Llama with Vision-Aware and Function-Calling Capabilities","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T15:32:48.356870Z"},"links":{"cited_paper":"/paper/2412.16364","citing_paper":"/paper/2501.13921"},"observation_digest":"sha256:239f298682ab5822d20b78dd107ece1f385606b776200cca59754e771741975b","observation_id":"7b2f1c54-e03b-44af-b3cf-ae100fa0aa5e","resolution":{"observed_at":"2026-08-10T15:32:48.411909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16364","snapshot_observed_at":"2026-08-03T08:15:38.147584Z","title":"A high-quality text-rich image instruction tuning dataset via hybrid instruction generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-08T23:34:38.789355Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":280,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:38.147584Z"},"links":{"cited_paper":"/paper/2412.16364","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:973aeb22e8e3b631b3641db56c1f739df0f4c4d25d850776bd092795aedcecce","observation_id":"1a5d8708-20ca-457e-91b6-9079ea167a94","resolution":{"observed_at":"2026-08-03T08:15:38.147584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16364/citation-record","integrity":"/paper/2412.16364/integrity","json":"/paper/2412.16364/citation-record.json","paper":"/paper/2412.16364"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T10:43:08.015968Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.015968Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:8e234cb01eb4589717ec8c09ceb8a245a38861fe3f26a3f07430b1364037ed91","observation_id":"5aacc674-890a-4e79-a0c6-81092622eb59","resolution":{"observed_at":"2026-08-11T10:43:08.015968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.638998Z","title":null,"venue":null,"work_id":"0bd277e5-0233-4976-a37d-54e4d28fce9d","year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.022473Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:993d483e4b23cfb8fb3d5cce544ca1f1d130c652894213b7e5b9f680f2e3dd26","observation_id":"aef6de57-ada9-4950-90b9-189813c046f7","resolution":{"observed_at":"2026-08-11T10:43:09.644327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.028411Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.028411Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:972f864990c7cb75c80840b1749d8a0a5807379a9e608382fdbb8450d16721bd","observation_id":"7a91493e-ad36-4acd-b3f5-756b4178e5fa","resolution":{"observed_at":"2026-08-11T10:43:08.028411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T10:43:08.034935Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.034935Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:9285a20e7bb701e9d1ec7c4678507455b2b97360287ce712ecd133a95d0310cf","observation_id":"dbad5b1a-de18-4cd4-95c4-376891cc6205","resolution":{"observed_at":"2026-08-11T10:43:08.034935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-11T10:43:08.040942Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.040942Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:6aaa1e201027ebd8f5cd5f6fe51ef0d6dc6334100fc806ec7efdd647ee6f5902","observation_id":"c9aced62-d86c-499a-9f61-c0bbade12ff2","resolution":{"observed_at":"2026-08-11T10:43:08.040942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T10:43:08.047462Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.047462Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:2b1d5e1977986cba32567b309c6a278861af0ba1adbe59c4102c1d7126c14bad","observation_id":"456f2e71-686d-4cbc-9525-5d55b18abacb","resolution":{"observed_at":"2026-08-11T10:43:08.047462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.054234Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.054234Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:57780903536713c295f7f13523051205e98633df22d6043efd1fd10da8c7fe7b","observation_id":"b1ccb274-a20f-4c6d-b211-3fd36e23abba","resolution":{"observed_at":"2026-08-11T10:43:08.054234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.059750Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.059750Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:33da6259b31ca25beae5ece4200d3300399fc3ce00677f67f753c4a1b0fb8195","observation_id":"2f1ee924-13e8-41eb-855e-e2ea59aa1595","resolution":{"observed_at":"2026-08-11T10:43:08.059750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.065314Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.065314Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:7d519a870fbb97eb1b1a1c1a90fe27440516fc7eb224d5ff1bf0ab991a78f599","observation_id":"08368eb0-7df9-4183-892e-b4b7cf4c808d","resolution":{"observed_at":"2026-08-11T10:43:08.065314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.071267Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.071267Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:dc722facd096d020f88cbe4a51beae81292b79b0f5bb3c571421745daa6f11dc","observation_id":"f5819198-0513-4c32-8114-88143f42e9d3","resolution":{"observed_at":"2026-08-11T10:43:08.071267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-11T10:43:08.076731Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.076731Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:89e5fecc58dc98416da8b83cc563c807e0f59df4cbdc672f8d02ed0d523bc022","observation_id":"31d5aa54-06cb-499c-a7a8-d6e5c7dbd311","resolution":{"observed_at":"2026-08-11T10:43:08.076731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T10:43:08.082289Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.082289Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:0123b6166761ffdbf7f42a6f579d7f276ebd90065f6cf73386a4826ded01f654","observation_id":"f68f39bf-0ae6-4b10-a708-822246bf7dcd","resolution":{"observed_at":"2026-08-11T10:43:08.082289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T10:43:08.088107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.088107Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:f7c779a8e85ffc56c440088d82af2b8f80952f768f086675990ba4873510a577","observation_id":"ad00a16b-2107-40b4-9d40-b3ff799b7734","resolution":{"observed_at":"2026-08-11T10:43:08.088107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T10:43:08.093445Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.093445Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:eb0a4f4179e282241df1258f85737c284f391bb96caaf0936916188f7700875b","observation_id":"b4953843-a2cf-4ada-84b5-63a33a282ab2","resolution":{"observed_at":"2026-08-11T10:43:08.093445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.099118Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.099118Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:004c303476f9d9ce42df9233262b08bff8c59c7c0b175aade6161f784b4dd464","observation_id":"03b891d6-79f4-47fe-b99a-8f1b243851b2","resolution":{"observed_at":"2026-08-11T10:43:08.099118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-11T10:43:08.104693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.104693Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:f867a1f1e0472965ad47e4cadfc714652e503e45fcbc50b04924108824ac0c2a","observation_id":"10e10636-9685-4993-b3c9-bb76777af97c","resolution":{"observed_at":"2026-08-11T10:43:08.104693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-11T10:43:08.111217Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.111217Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:a6c0fa787f1b851896a0468819be83ac0943d42632f39cb70d8f8987b3435610","observation_id":"6e901dd1-c024-4d6e-a312-6a7d435ad9e5","resolution":{"observed_at":"2026-08-11T10:43:08.111217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.552848Z","title":null,"venue":null,"work_id":"4699271d-1a0e-4a60-acad-fe097eb4c3de","year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.116972Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:d0a358b0987bffb07311472892fa58f918d6b77be66548a072f5f8e5c5aec078","observation_id":"1363a921-11cf-432e-9ef4-255feebfeea8","resolution":{"observed_at":"2026-08-11T10:43:09.558346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.536371Z","title":null,"venue":null,"work_id":"0169adfe-5a55-4e9d-a66a-d6d74f4478f0","year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.121871Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:8c54581d1b4c452f3d9e6b547a0822cea7088bb8cc3aa3e3e7c40de0cae6365b","observation_id":"fd1c25d7-e7d1-495c-90a9-16cf49b50fc8","resolution":{"observed_at":"2026-08-11T10:43:09.541404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-14T20:22:04.930480Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-11T10:43:08.126593Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.126593Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:0647e85fe601ab456b67cb4ff4bd26f378fb34380893e744369657c03c818a84","observation_id":"747d26dd-1952-4d61-a751-8fa681cfff86","resolution":{"observed_at":"2026-08-11T10:43:08.126593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-12T22:59:05.910546Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-11T10:43:08.131404Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.131404Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:ae3bac46c88cfc40c1ca1f952468552aa67cd5b210c084b043aaea1c7d7715e2","observation_id":"4bad5c29-2f67-490c-be1d-f7bb08f05aa9","resolution":{"observed_at":"2026-08-11T10:43:08.131404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-14T05:56:43.101287Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-11T10:43:08.136042Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.136042Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:5d4772ab95af75f6380e67890f9bee1621de48f27044afa15e50fea428d296f9","observation_id":"d522efe4-aeba-4d33-b122-5344e7deb0a1","resolution":{"observed_at":"2026-08-11T10:43:08.136042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13840","last_updated":"2025-07-02T21:53:51Z","snapshot_observed_at":"2026-08-13T11:10:18.261282Z","submitted_at":"2023-06-24T02:25:56Z","title":"Beyond Scale: The Diversity Coefficient as a Data Quality Metric for Variability in Natural Language Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13840","snapshot_observed_at":"2026-08-11T10:43:08.140756Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.140756Z"},"links":{"cited_paper":"/paper/2306.13840","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:e523820ddf410b05ee1abbfdf47d426bb69c7e5db0a7779e0ff103e6a732e72c","observation_id":"255da361-d0a9-4079-9334-10dfc9b4a91f","resolution":{"observed_at":"2026-08-11T10:43:08.140756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T10:43:08.145499Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.145499Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:9d387dc3efab8b51141b1e705397180162db689d74437c8ce9021d4e71f173f4","observation_id":"be2a0fa4-5fcd-42d2-8c89-e5a8607e13d9","resolution":{"observed_at":"2026-08-11T10:43:08.145499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10020","last_updated":"2023-09-18T17:56:28Z","snapshot_observed_at":"2026-08-13T10:10:39.294234Z","submitted_at":"2023-09-18T17:56:28Z","title":"Multimodal Foundation Models: From Specialists to General-Purpose Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10020","snapshot_observed_at":"2026-08-11T10:43:08.150494Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.150494Z"},"links":{"cited_paper":"/paper/2309.10020","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:e693ea3086f2c1adab729d17eec916710485f1d98ba52586f8255f6224782e53","observation_id":"9fc6c466-f7e4-4222-a81a-f9a6d9f3d38b","resolution":{"observed_at":"2026-08-11T10:43:08.150494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.155150Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.155150Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:db00e1a8f0bc7c25a42e6cc113abc841822a29950728928db53e976c801d1701","observation_id":"28191912-273f-4eef-b0c1-c64b068cea95","resolution":{"observed_at":"2026-08-11T10:43:08.155150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12032","last_updated":"2024-04-06T03:52:04Z","snapshot_observed_at":"2026-08-13T22:13:22.197575Z","submitted_at":"2023-08-23T09:45:29Z","title":"From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12032","snapshot_observed_at":"2026-08-11T10:43:08.159936Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.159936Z"},"links":{"cited_paper":"/paper/2308.12032","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:e6a8940815a53f746a0838ccabcb07f803c0a2fc3a6d4920e2e3cddf2db364ab","observation_id":"67d16506-8c00-4edb-9dcd-180883516aa8","resolution":{"observed_at":"2026-08-11T10:43:08.159936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.508424Z","title":null,"venue":null,"work_id":"775e13f5-c27b-42d9-a5e3-f5347dec4fb2","year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.164632Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:9f34a959b25f85e8a58044c63dd8ebfd7b4e9d954f2ef9142cafe9af831b9c16","observation_id":"3fee9e36-0d0d-4994-9c58-de20c1335339","resolution":{"observed_at":"2026-08-11T10:43:09.513539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.169290Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.169290Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:dbfd2ef868100c66f65ab2881e5a0b2dbf9954ec2d4de8d3a765517c9e50d14a","observation_id":"42e9e741-e613-40d1-912a-94582f8773d0","resolution":{"observed_at":"2026-08-11T10:43:08.169290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.174228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.174228Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:fdc51c0248f17b7ffee11608cbec7aee81be58751a575e850daf0a9d36167c1e","observation_id":"8cc2fb93-52c7-4778-892d-c0421725b7e1","resolution":{"observed_at":"2026-08-11T10:43:08.174228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.179262Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.179262Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:753989210b5841fa6516673f14df495829efa4ba316107778017288393183a11","observation_id":"e17d3b1d-91f7-4c8b-9d5a-d2832ddd1a74","resolution":{"observed_at":"2026-08-11T10:43:08.179262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.184299Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.184299Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:1b2a6b9a2032833de85ca13b61a779747cf556a3260f1132d6853352a69aa5cc","observation_id":"8b73e3aa-3a16-4350-bcc1-3e5a57987d8d","resolution":{"observed_at":"2026-08-11T10:43:08.184299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.189517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.189517Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:fddb387ffd44ae696a1eba15558fa6d6c40f4fe3b4317cdbfd2156aa6fdac0fe","observation_id":"79c41576-adb8-49a9-8249-12504a124eb8","resolution":{"observed_at":"2026-08-11T10:43:08.189517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T10:43:08.194693Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.194693Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:882daaf08b3761b4ed016976ee4ea79d6fc1a21d67a5b298b3584a1bc6bf9c3f","observation_id":"823076d6-51a6-4cc2-a594-43e901f5f457","resolution":{"observed_at":"2026-08-11T10:43:08.194693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-11T10:43:08.200561Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.200561Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:7f13b2edfe78587fe690439c009311405f3d58ae69900f6bfb770cdf9319500e","observation_id":"9d3cded9-7343-4fba-93c2-17c02b5ab6ce","resolution":{"observed_at":"2026-08-11T10:43:08.200561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-13T05:57:08.016883Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-11T10:43:08.206401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.206401Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:88363744649b035b80dbf0ab21bb9f30a784c818ac072a0e196b1c30f3874a33","observation_id":"68958a47-46d5-4079-9441-3d430f02dc99","resolution":{"observed_at":"2026-08-11T10:43:08.206401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-15T01:58:37.525169Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-11T10:43:08.212053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.212053Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:b96e2c11c2627b726bb519aef5d277e48b9b38e3f8c72a5aafcfd57684793469","observation_id":"d7a9b546-68f6-4722-add5-1fba7b2724c1","resolution":{"observed_at":"2026-08-11T10:43:08.212053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T10:43:08.217303Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.217303Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:c8cf674384e2bd4194ca068117ca81c9f211fec1faed6a07fd86b37e7176c907","observation_id":"637a3691-509c-46d7-9e79-adb2080d4e06","resolution":{"observed_at":"2026-08-11T10:43:08.217303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.223014Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.223014Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:b215b646cb12d2bb2f5102addbe1c3fb88978f24cb7f2075ca71d7c0e768a9e2","observation_id":"f08d9e99-b392-4428-9f5f-de5d3983499d","resolution":{"observed_at":"2026-08-11T10:43:08.223014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.227921Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.227921Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:d99bb7095aa7e47f2e44ce866c1e10ef93109e7a0a9a568588d1a975642fd3a2","observation_id":"ae2dc1fe-b717-4c00-97f1-1ca9741ab3a7","resolution":{"observed_at":"2026-08-11T10:43:08.227921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.233284Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.233284Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:55a048b8e7bf6891d43b2068832593d36da177aa7987a046b7e8f0b894eef2e8","observation_id":"5511b1bc-08cb-4d2a-a873-3ee6dc34abfe","resolution":{"observed_at":"2026-08-11T10:43:08.233284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.238556Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.238556Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:48599ddf23b370ae6786a8dba6a532c7e8fdd29556e829dc987e6da89f38a116","observation_id":"85c2ceb8-1290-4bf9-9aa0-94302cca30b6","resolution":{"observed_at":"2026-08-11T10:43:08.238556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.243860Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.243860Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:1862c1eb22c0114edaef3f4c8ae67da23d139b9881cfc8b0d58b776e729d3995","observation_id":"7c107ef1-2274-45ad-b018-1025e2bd7f32","resolution":{"observed_at":"2026-08-11T10:43:08.243860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.248898Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.248898Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:91562a2585bd58478699240579e25e03f3a5d3a12a54c07c621b82da280d5127","observation_id":"f2ed88f0-b8b6-4a0c-bcda-7f20f7169886","resolution":{"observed_at":"2026-08-11T10:43:08.248898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-11T10:43:08.254025Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.254025Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:b778628ede816067d5dd76abfd449ef4fab53985dbbb2979d23ee5597a446e1a","observation_id":"de5324e3-3a32-44a0-a14c-207650ee37e9","resolution":{"observed_at":"2026-08-11T10:43:08.254025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-11T10:43:08.259469Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.259469Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:11a29bca2ad97d3ae599b7147016e9bd580d5552f775bcdc3f5da6aac46f43ad","observation_id":"fa9e2839-d2f8-4f32-b1b4-61908a1ba1e7","resolution":{"observed_at":"2026-08-11T10:43:08.259469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.264439Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.264439Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:b8f8c8a0f772687fdcba2ab712c715c76286b7ac8a0998c0d62b48e467f94217","observation_id":"83e3ba0f-5a8b-44cf-98c4-82a29bed14f3","resolution":{"observed_at":"2026-08-11T10:43:08.264439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.344688Z","title":null,"venue":null,"work_id":"e6c5e700-275c-4191-8572-bfd325516b20","year":2021},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.269511Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:f032a5e5034315d42977f215f6fd7e5bb7b5280bbf1f6f996e2c1f268829441d","observation_id":"084ea4e5-4ca3-4848-b4e4-03a678783b6c","resolution":{"observed_at":"2026-08-11T10:43:09.350050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-11T10:43:08.274466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.274466Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:a1081a1568e6067ad64e82bcd5bd63eb4426998aa5a28b889abcf99723c37de2","observation_id":"6ee6884b-69f4-481a-9f67-263f29763ccb","resolution":{"observed_at":"2026-08-11T10:43:08.274466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.279350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.279350Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:367c6e9c3a96e2531436e667777658e2e9be99ae733c4f34c875dec18cdbbedc","observation_id":"660abd36-6da8-426d-a5df-ea81382b457c","resolution":{"observed_at":"2026-08-11T10:43:08.279350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.284180Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.284180Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:f1a1cf24867018cb1c0e91e1d6e52f0f9b700bfef45a64b5c9f46010c1fa292d","observation_id":"db90e8f6-2ebb-4bde-8364-563eaeb3d8d3","resolution":{"observed_at":"2026-08-11T10:43:08.284180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T10:43:08.289122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.289122Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:7350f67cdc1da49c4a006a2f10155167a8f7a80448a51b3108ac7bd72d7fd036","observation_id":"3504fa73-4fd3-4924-a1f6-f4c77c5adda4","resolution":{"observed_at":"2026-08-11T10:43:08.289122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-08-15T15:06:42.719366Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-11T10:43:08.294005Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.294005Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:0f0e4d0b5e41cb543d84057541f3e609e9e72e2d4aa32a2cf5bdf39049c4edff","observation_id":"37a2c492-2125-4336-b4b9-052f6a34d4bb","resolution":{"observed_at":"2026-08-11T10:43:08.294005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.301389Z","title":null,"venue":null,"work_id":"7c3e80dd-8edc-45dd-831f-718b758a0cb0","year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.298833Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:f2c5c558bc53508489b2a22dace5518488dcbe517c1201524e42a339c9561e2e","observation_id":"819bbdeb-4eee-42cb-8852-9622a2f95d9b","resolution":{"observed_at":"2026-08-11T10:43:09.307105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-11T10:43:08.304211Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.304211Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:8338b8c40e39ab0d859fe0e82c2b921c0179e0cc1861e6fdc5bc05ad38d0fe16","observation_id":"1bb51277-e1c3-4935-83b6-ec35b11cdbb0","resolution":{"observed_at":"2026-08-11T10:43:08.304211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-13T00:51:59.402203Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-11T10:43:08.309295Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.309295Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:df6e19bd39700ea8f49c2b999df60b92565b647966dd6e2a086f1f8f6bf693cd","observation_id":"bd986c29-9567-499f-ab33-9bc948658b71","resolution":{"observed_at":"2026-08-11T10:43:08.309295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T10:43:08.314525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.314525Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:27afad88e369e88aa53938134e690976c427751284bc5827a01158dfb8f4ea19","observation_id":"ef38d3f2-5405-4ae5-bee0-17e04f7452bb","resolution":{"observed_at":"2026-08-11T10:43:08.314525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-08-13T05:54:33.801989Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-11T10:43:08.320223Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.320223Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:82cae0d35c9e4bbc67737213b3eae97e6891c499fa1e33982c4a2e19dd989c56","observation_id":"bf827e25-0aed-4782-8627-8dfd9377e165","resolution":{"observed_at":"2026-08-11T10:43:08.320223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-11T10:43:08.330976Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.330976Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:73b31119a741882cfc9d24658590cf0e12ca3edc67d7b4fec1fa3a5c3cbc7bf2","observation_id":"bba694e8-6c14-4073-a46e-480ac2bcdcea","resolution":{"observed_at":"2026-08-11T10:43:08.330976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-11T10:43:08.336017Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.336017Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:011db019c759a47153df55b7ee538328b6caca7786a400e9d668374381b04ecb","observation_id":"9e3dde9d-e7b0-4f54-b686-4a4033c772ec","resolution":{"observed_at":"2026-08-11T10:43:08.336017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:09.283081Z","title":null,"venue":null,"work_id":"e7273ba2-0f96-45f0-89c9-13c07cafe60e","year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.341568Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:90ae3a348e6be6f70d3bc83ebc270f5e52fcb95eed24d132572a61bf88abfec7","observation_id":"d493ed16-3acd-4a52-b132-6fa5eed4ebed","resolution":{"observed_at":"2026-08-11T10:43:09.288560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.346668Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.346668Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:71b9af5db47a27c36416db2c782bc48d1f5695ef2261fc9a27c442a816db152b","observation_id":"039c9c1c-7118-4aa7-b692-2ad34cec58f7","resolution":{"observed_at":"2026-08-11T10:43:08.346668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-13T11:05:54.841341Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-11T10:43:08.351843Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.351843Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:9a2929fa9163a339d728aa8790db725e6d77c43d180f208de7e67cafc580b9c9","observation_id":"76e70a1b-40d9-4db0-b8c3-58ef0c8b9815","resolution":{"observed_at":"2026-08-11T10:43:08.351843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06731","last_updated":"2024-08-27T19:51:13Z","snapshot_observed_at":"2026-08-13T05:05:17.319161Z","submitted_at":"2023-12-11T09:44:41Z","title":"Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator","version":6},"cited_work":{"arxiv_id":"2312.06731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06731","snapshot_observed_at":"2026-08-11T10:43:08.438315Z","title":"Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator","venue":"cs.CV","work_id":"683ead8e-bd0f-4581-9f32-bc19d4aeb9bb","year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.357447Z"},"links":{"cited_paper":"/paper/2312.06731","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:b30a409ca83376c78bf4952951eb3c0ce30656ef9503f97f95101055d428fdac","observation_id":"9f71f3fe-2089-4064-b1c9-612f4db72381","resolution":{"observed_at":"2026-08-11T10:43:08.445289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T10:43:08.367718Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.367718Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:8241ba31277f1225e77c1b7dadb4f2a823b0bdfc742d287c60e96e7245745190","observation_id":"f5749c3a-7a2a-4bff-86e9-52f2ca6bdcea","resolution":{"observed_at":"2026-08-11T10:43:08.367718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.374718Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.374718Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:ba9823a9ddfd0384844770df1edb1294577ecd6628d5cb006563301f3d87d6f9","observation_id":"746f9fb3-8af6-47cc-a585-49c169dd95e8","resolution":{"observed_at":"2026-08-11T10:43:08.374718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:43:08.380678Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.380678Z"},"links":{"citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:eded1984128f17d5718ac370955fdd34b1ace7e736fcda6f5b67bd65c20d3024","observation_id":"240ab25e-bb93-4ba0-9e60-afb92eeac574","resolution":{"observed_at":"2026-08-11T10:43:08.380678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 2 inbound Pith citation observations for arXiv:2412.16364."}