{"as_of":"2026-08-15T12:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b603c6c47a22e9fe7494bb66826b1450dce685c12d950be332982be05dc82c43","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:36:36.109735Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:23:53.069460Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:50:57.754355Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19103","snapshot_observed_at":"2026-08-05T15:23:53.069460Z","title":"arXiv preprint arXiv:2411.19103","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-14T09:19:24.424350Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.069460Z"},"links":{"cited_paper":"/paper/2411.19103","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:04dff7b2ae65db7b02e8f27f747f12538c6690993b615618daa13e4c19e9c24e","observation_id":"42f4af09-c14f-415e-a1e6-575f581e615f","resolution":{"observed_at":"2026-08-05T15:23:53.069460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2411.19103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19103","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c83e50be-1b75-48c0-83d8-25fd91d755d5","year":2024},"citing_paper":{"arxiv_id":"2604.11490","last_updated":"2026-04-16T23:50:04Z","snapshot_observed_at":"2026-08-11T15:57:44.785010Z","submitted_at":"2026-04-13T13:56:00Z","title":"Anthropogenic Regional Adaptation in Multimodal Vision-Language Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:29:12.064221Z"},"links":{"cited_paper":"/paper/2411.19103","citing_paper":"/paper/2604.11490"},"observation_digest":"sha256:66378664ea4a0f8855a950da4d8554e77d3beb30efec45c6b40145e57fdcfeb8","observation_id":"579ef28e-9638-4b05-bd0d-dbb1829f3b4d","resolution":{"observed_at":"2026-05-11T08:50:57.757159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.19103/citation-record","integrity":"/paper/2411.19103/integrity","json":"/paper/2411.19103/citation-record.json","paper":"/paper/2411.19103"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-12T10:36:35.852542Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.852542Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8c789ee5fa5a2ecc252f089f4bb29024ea85d0bd088175c673ff1f18c48da6b0","observation_id":"c3ec4983-b98b-4b07-bdfe-49a8bae6b79d","resolution":{"observed_at":"2026-08-12T10:36:35.852542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T10:36:35.858504Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.858504Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8f921d008c9c344254259c5a108cb1188077956c01e392c41dc4e91b3bc49e72","observation_id":"c7f4e65e-14c8-4085-9674-9268d6349542","resolution":{"observed_at":"2026-08-12T10:36:35.858504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-12T10:36:35.864070Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.864070Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:d49ba095c075ef40b15b262a631eda165019d48fe131e52a72ad95c0e53fa3cc","observation_id":"c1e5ee41-0493-4459-a3d8-4db1ff6bf164","resolution":{"observed_at":"2026-08-12T10:36:35.864070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.869702Z","title":"Claude 3.5 sonnet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.869702Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:97e99d7f981feada0515b3be40860a0f9d701cfc9761ba6ca7b8b181744c9ca9","observation_id":"b93e74b5-54da-4b69-8c7c-7cd75a6814ba","resolution":{"observed_at":"2026-08-12T10:36:35.869702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.921422Z","title":"Are we on the right way for evaluating large vision-language models? In The Thirty-eighth Annual Conference on Neural Information Processing Systems, 2024","venue":null,"work_id":"278fb1eb-7902-42e8-a83c-448ab215f1c8","year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.873893Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:52722d44a6a03814655025a0dc50a411beefc0b4f00195f4b15e4244fa16d371","observation_id":"3b116a9b-aaf5-4d76-9988-cf27460567a7","resolution":{"observed_at":"2026-08-12T10:36:36.927658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T10:36:35.879674Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.879674Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:31cf34d5593c97e33b7257dd745f8656fa1e3db342011178ebe2d75fb7268f4e","observation_id":"b16a62da-450e-4651-b93b-b9fed078a453","resolution":{"observed_at":"2026-08-12T10:36:35.879674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-12T10:36:35.885630Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.885630Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:2685460e15bf5f529462db413ddf94d2e008ca7417bd340e5b0dde9b06e5cdc9","observation_id":"246d330c-3898-44fc-b5c1-fd9b8351ba9f","resolution":{"observed_at":"2026-08-12T10:36:35.885630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11691","last_updated":"2025-08-28T09:40:49Z","snapshot_observed_at":"2026-08-12T23:21:07.520817Z","submitted_at":"2024-07-16T13:06:15Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11691","snapshot_observed_at":"2026-08-12T10:36:35.890601Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.890601Z"},"links":{"cited_paper":"/paper/2407.11691","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:d235b44cfb23ac2981096ab63611e7626f4140affe7272d94b774937f7999868","observation_id":"5714edc0-0fb7-401a-aa5b-ba5e6dfac8b5","resolution":{"observed_at":"2026-08-12T10:36:35.890601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.907638Z","title":"Pororo: Platform of neural models for natural language processing","venue":null,"work_id":"5fbb8a7b-9a40-4e3a-8e51-8efcf7a96ae1","year":2021},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.895328Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:56b95976cce02b8d258c1a6d1f85a439064b81381cb89c4005d848d6e70a79aa","observation_id":"51c57779-af72-41e5-8fee-5046260785c0","resolution":{"observed_at":"2026-08-12T10:36:36.912470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.893318Z","title":"Icdar 2013 robust reading competition","venue":null,"work_id":"0869c512-2c43-465c-b199-3061802251c5","year":2013},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.899817Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:93178698ef524a95883ac0129f716817ad446e846a777576efb2742995a7f03c","observation_id":"c0b004ca-f92b-4cb4-a871-3eadd68f546f","resolution":{"observed_at":"2026-08-12T10:36:36.897869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.879738Z","title":"Icdar 2015 competition on robust reading","venue":null,"work_id":"8b917e51-d938-4277-97d9-33142e4bd3f7","year":2015},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.904048Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:006c467ef8344f6ff2b81edff7be171402cabc4cb7face8edc2ef0c7f70142ab","observation_id":"d1372440-1e8f-4eac-8b8a-cbe10f98cbec","resolution":{"observed_at":"2026-08-12T10:36:36.884238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.865650Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":"17acc4ab-76c0-4cd0-8587-5c1916479234","year":2022},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.908719Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:e9ad43219064f7b2e84953658f2cf61e2d494ff528692258b3914c4b575245d1","observation_id":"51682c5f-09ce-42e3-ac5a-701740ba3fe5","resolution":{"observed_at":"2026-08-12T10:36:36.870270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.851619Z","title":"Korean Localization of Visual Question Answering for Blind People","venue":null,"work_id":"8f0428ff-eac6-4075-9f8e-922adfc4ca3a","year":2019},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.913040Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:85c766a843ff2401ae887869fa5380242a130f77086858b1112e4fd2776c2fdb","observation_id":"ef31c4a8-ef05-48a1-ab75-b25a673efd42","resolution":{"observed_at":"2026-08-12T10:36:36.856356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-12T22:59:05.910546Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-12T10:36:35.917708Z","title":"Building and bet- ter understanding vision-language models: insights and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.917708Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:709303c0d218253217c165192341d1217a8b3efb91d9173a3b8f223e2be9d0c1","observation_id":"e481b500-b1fb-47f6-a568-685b8dc5b950","resolution":{"observed_at":"2026-08-12T10:36:35.917708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.837416Z","title":"Popeval: A character-level approach to end-to-end evaluation compatible with word-level benchmark dataset","venue":null,"work_id":"806e47a2-6ecc-4e4b-93b1-dd9d27f615c4","year":2019},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.922716Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:b77420f911cce448d1ce0a8f5d98c5edd84a13c50da4489fc5426c49cd82d6d6","observation_id":"eb303d3c-5e48-4e5f-9f4b-e34c74bfd650","resolution":{"observed_at":"2026-08-12T10:36:36.843146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T10:36:35.927460Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.927460Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:6bbc00c3fbb720daa5de341e69bec938998c7c18b170817bb949b1f0e4face2e","observation_id":"eb77d461-959f-4b92-896c-53fd31b8bfbf","resolution":{"observed_at":"2026-08-12T10:36:35.927460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.932104Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.932104Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8ce96f24686a41523f95378a7d7a5c88f5dbf5c70ae8c6a0e9fb690e7f7e14dd","observation_id":"17dbb9ee-fe15-4080-aa48-7c3b080ca89e","resolution":{"observed_at":"2026-08-12T10:36:35.932104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-12T10:36:35.936853Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.936853Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:49a14585ee7ed74a0f4ae7e84e3002347d94d7c0429a6f4d1077ea5c19d174c6","observation_id":"67f14028-ed47-4e08-9371-ad03019cda90","resolution":{"observed_at":"2026-08-12T10:36:35.936853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-08-14T10:12:58.959257Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-12T10:36:35.943050Z","title":"A survey on benchmarks of multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.943050Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:c7779d470dfc8ad767801c2cd6253fe6ddfbea0805388d148cf8ed2627ea013f","observation_id":"8fbd28c9-3f04-4a69-a00d-4c74e4a7748e","resolution":{"observed_at":"2026-08-12T10:36:35.943050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.948507Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.948507Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:56e8dce0036c5f3f0c40dc862cfe35596d005c86a57120b118966d16e093b761","observation_id":"16a8dd29-5225-48db-94d6-791e9927e454","resolution":{"observed_at":"2026-08-12T10:36:35.948507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.952362Z","title":"Visual instruction tuning.Advances in neural information processing systems , 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.952362Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:99cd520489245ce61c3e2d86e786685c25056a8c71e04c11e79105b2ddf7e2ef","observation_id":"e9b90bd9-b359-4b8f-b787-b79dee9b7014","resolution":{"observed_at":"2026-08-12T10:36:35.952362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.956783Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.956783Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:3eeabbdfb55dc565a664508c5d982963cdbd53657d2e475a12a4708680051ca4","observation_id":"9a7b7c2d-3b38-464d-a53e-41b2259a319a","resolution":{"observed_at":"2026-08-12T10:36:35.956783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-12T10:36:35.961256Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.961256Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:d4db0f5c60cb075b983051b4716ffbeebf465069d02a716a8ac9b2202c576923","observation_id":"644ef2d0-4c4f-46d9-9072-4f75b800ab02","resolution":{"observed_at":"2026-08-12T10:36:35.961256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-12T10:36:35.966053Z","title":"Deepseek-vl: towards real-world vision-language under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.966053Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:e5f01cae3159b5dd2c564c70a8baf80a3ab5fa0828c0b24f567074673853675e","observation_id":"62577d7d-b611-4861-a10a-b66b17ba5381","resolution":{"observed_at":"2026-08-12T10:36:35.966053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-15T01:58:37.525169Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-12T10:36:35.970570Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.970570Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:dda7b11f3e25cdce06beae7b9fa0437388bb4bf6a7d04fa742aa048d889d0b4f","observation_id":"a482db7a-3c49-4dcf-a98d-b55608b817c6","resolution":{"observed_at":"2026-08-12T10:36:35.970570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.788805Z","title":"Cord: A consolidated receipt dataset for post-ocr parsing","venue":null,"work_id":"3a506e1f-0f64-4f6a-af12-cfc53d6e777e","year":2019},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.974921Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:eef21ada746b62aa507d4db7b71f275849227bdc852c5216fcd8fa0f28e199ba","observation_id":"c061e2c0-08c5-49dc-b3f4-024b4b23566d","resolution":{"observed_at":"2026-08-12T10:36:36.793542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-12T10:36:35.979973Z","title":"Kosmos-2: Grounding multimodal large language models to the world, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.979973Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:cf178b8dec7d52f5fe30af3cfa1dba1ad6aa0d351c30fc4d14e23632ffc4391d","observation_id":"da1c4e4a-caa6-43f2-8733-0d84693ad957","resolution":{"observed_at":"2026-08-12T10:36:35.979973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.985077Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.985077Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:0bb70462499ee3d0f296665fd2f41f5672dde09f91f86f86b5d4acb5fe3c7a96","observation_id":"f7e29a92-e734-4ce7-a87b-d385a2a9644f","resolution":{"observed_at":"2026-08-12T10:36:35.985077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.990115Z","title":"Exaone 3.0 7.8 b instruction tuned language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.990115Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:ddc70dbf97ae79cff16e86c24eea331b975d760fc38ccd4a0b1cc87c74edb7f1","observation_id":"604c59d3-a8fe-4a00-b43c-68248d20f7d1","resolution":{"observed_at":"2026-08-12T10:36:35.990115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.995460Z","title":"X-LLaV A: Optimizing bilingual large vision-language alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.995460Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:5b14ba974e01b54f2726fe4e590c648d951414fa23e2001330eb2f3ed57bc803","observation_id":"b23c4022-859d-42bf-b0fa-541cbf73ec0c","resolution":{"observed_at":"2026-08-12T10:36:35.995460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T10:36:36.001932Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.001932Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:341f5e555370d17d425f1da8eba228188d74ad1e5639d4a4895d26dc17527ab4","observation_id":"19ec7602-0137-4c88-a501-a41b2eee73c8","resolution":{"observed_at":"2026-08-12T10:36:36.001932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.006796Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.006796Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:12c146db5e77ecfd3eb052ed2b2609166aa76784b634a88838b80b32730e9ff2","observation_id":"452c9471-7122-4496-a1f6-8cb1ff36ffa1","resolution":{"observed_at":"2026-08-12T10:36:36.006796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T10:36:36.010906Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.010906Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:bd0ac17e419041de3b8771b905beb08f3c872a009dc7e6b5b9545809347a792c","observation_id":"8db81b3a-4c41-42d0-a111-7d3770ee2e35","resolution":{"observed_at":"2026-08-12T10:36:36.010906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-12T10:36:36.015486Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.015486Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:a69fff523641f90ff69693c1f15c54df717ae0b6f6ad0a3e3038ef4aa72b685a","observation_id":"3545269b-b6bc-4f4c-9c61-60214502c22f","resolution":{"observed_at":"2026-08-12T10:36:36.015486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.020089Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.020089Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:f47f1ce035122e3a2ebae321f343f59252dffedd91e18409a3e040a3e08a335e","observation_id":"8960d159-d36d-4147-9bed-865e5c3489f0","resolution":{"observed_at":"2026-08-12T10:36:36.020089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16153","last_updated":"2025-01-26T15:34:59Z","snapshot_observed_at":"2026-08-12T22:59:25.550697Z","submitted_at":"2024-10-21T16:19:41Z","title":"Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16153","snapshot_observed_at":"2026-08-12T10:36:36.025075Z","title":"Pangea: A fully open multilingual multimodal llm for 39 languages","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.025075Z"},"links":{"cited_paper":"/paper/2410.16153","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:1e2ac8db8d88ff1b12bfa10c9066634e4fce9859d406fd856f3468c2a7f7985b","observation_id":"5befc4bb-fea9-4a40-bb2a-3c5767bb97a3","resolution":{"observed_at":"2026-08-12T10:36:36.025075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.029653Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.029653Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:53b84422dfcda4f5635ca44db77c8105e3243eb487b2f14c9c51f0a046fcbc83","observation_id":"2f56c486-75f2-45ef-b34e-0104b5948ad0","resolution":{"observed_at":"2026-08-12T10:36:36.029653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-12T10:36:36.033894Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.033894Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:729dbc2a1a0f460fe6f96b9a01e98098bbd0ef2f397315ab7db060e1ceb096ab","observation_id":"adab2f40-cc40-44f4-8c01-717e2f6e1b60","resolution":{"observed_at":"2026-08-12T10:36:36.033894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.741499Z","title":"Swift:a scal- able lightweight infrastructure for fine-tuning, 2024","venue":null,"work_id":"f1f6a4a1-2a33-4225-ab7a-032cc0212e11","year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.039180Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:228f4dc975a03e519ebfb52f017e1d0fd97c723b15f8d92d921bfa95a032c9b7","observation_id":"8f6afc56-4097-454a-9150-3fc39708ad0f","resolution":{"observed_at":"2026-08-12T10:36:36.748316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.044493Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.044493Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:7905a7af271ae4fa9aa4313d1723b54873fa0dee0e104e40ed19c70202f18407","observation_id":"80e390e2-b100-4c33-a098-68045181a8b3","resolution":{"observed_at":"2026-08-12T10:36:36.044493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-12T10:36:36.049341Z","title":"축구” (soccer) and “미식축구","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.049341Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:7721809fc69b7bc459545321bfbc8667faec81075a8adae89c9e96f4cb55988a","observation_id":"139285f2-244a-45bd-973c-d4c7a734478c","resolution":{"observed_at":"2026-08-12T10:36:36.049341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.714798Z","title":null,"venue":null,"work_id":"c80bf80e-6ab3-48b7-813f-39ca1e701595","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.054202Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:13b590260244b2af684feb8526f61366cd7fdfed156f312b420654e806553083","observation_id":"809f3286-352b-42bf-9f2c-9a5b7840e845","resolution":{"observed_at":"2026-08-12T10:36:36.719589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.701189Z","title":null,"venue":null,"work_id":"ff6871e3-b8c6-4413-a4ff-1ba9efab3492","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.059447Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:349b80e26bbf8357740f8e0b01ce7d57cd9757a41e6bbc1bb527f29d0c06ecc5","observation_id":"fcd469a4-f479-4bf2-a266-66771f85addc","resolution":{"observed_at":"2026-08-12T10:36:36.705504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.686865Z","title":null,"venue":null,"work_id":"88b25a2c-ec3c-4516-a0b2-130019c91dc7","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.065506Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8aae88f66d096c8af1063e961a481abd3cb4c05e8bcabf88147fa2984c7e10a3","observation_id":"4af0a18f-ab65-4411-9732-09c638dc520c","resolution":{"observed_at":"2026-08-12T10:36:36.691332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.671793Z","title":"# 출력 형식 - 첫 번째 줄: `어시스턴트1_점수 어시스턴트2_점수` (예: `8 9`) - 두 번째 줄: `유용성`, `관련성`, `정확성`, `세부 수준`, `한국어 생성능력` 기준으로 점수를 설명 하는 자세한 문단을 제공합니다","venue":null,"work_id":"ebad8bda-c9d1-40be-be97-5ad97fe50ee8","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.069989Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:0602d0eb843cadcd4f5eac5687f7e0137b832b34220f5bdd84306b302e584c1c","observation_id":"3a37a793-b66e-49fa-b975-b201fe16a6bd","resolution":{"observed_at":"2026-08-12T10:36:36.676764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.659016Z","title":null,"venue":null,"work_id":"ca3ac2fd-4aff-4be5-b615-a71ac1c3f326","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.076612Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:cd8a6efc1ae76c369752bc082cc14d3ffe8fc8790c0fbb64f8935ba6ae6642d3","observation_id":"9e90c8ed-c6c5-420f-97fe-23b5148bdec5","resolution":{"observed_at":"2026-08-12T10:36:36.663376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.645224Z","title":null,"venue":null,"work_id":"24618350-8352-4c86-9f84-3fc4ed373392","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.080778Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8945d142795ea59dc08423f27b4f75cc539fc3920e83cc9de842421048b4414e","observation_id":"8c43a167-2fae-459b-9913-4bb7fe9235a8","resolution":{"observed_at":"2026-08-12T10:36:36.650092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.626843Z","title":null,"venue":null,"work_id":"5e5eaee9-4519-4cd6-b427-a482946332a4","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.085491Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:38c461726d6703fb810eed5a2e4f7ab54b2967c3b36ca732124b682f45a12408","observation_id":"5c19e8b7-c018-4eb3-bb3b-fc4f50a87db1","resolution":{"observed_at":"2026-08-12T10:36:36.631921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.610069Z","title":null,"venue":null,"work_id":"77a4972a-7d9a-4b26-9bd8-886ec974bfc1","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.089879Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:5b0445de26c804f79cfd1422cebb22b5d879b58cad666056c24d396166b3bfdd","observation_id":"bc7c32ca-e971-4795-8d4d-38402f0f4955","resolution":{"observed_at":"2026-08-12T10:36:36.615033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.597356Z","title":null,"venue":null,"work_id":"357113cd-903f-4b29-b9ef-bd3e28e3c10c","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.094275Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:4aeaaa3c440f4be865a647fa6238e5d2453a7924b7cbc0c76baf2bbfa6eb75e5","observation_id":"36ebed22-f097-4b91-93c6-d375de28c098","resolution":{"observed_at":"2026-08-12T10:36:36.601697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.584901Z","title":null,"venue":null,"work_id":"f1cb90c5-385f-4222-9b6a-ff2a05233c91","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.099332Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:9b64f7566e1d41158efac4fb9f0b04877d08a2844671f28e0836d890f863b130","observation_id":"51633135-2074-408c-9ef9-6e88c3558468","resolution":{"observed_at":"2026-08-12T10:36:36.588969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.572060Z","title":null,"venue":null,"work_id":"46aff5c3-909c-4116-a5ab-1522fdddef50","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.104063Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:1c32953aded1f02c78a4807a388fbf5ae6610e42c5d8452fa66bdea5ea1ed194","observation_id":"21d48145-90f6-48b4-8569-dd08c1d97009","resolution":{"observed_at":"2026-08-12T10:36:36.576150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.558984Z","title":"STARBUCKS","venue":null,"work_id":"152cc437-5884-452e-982b-bc5c3295d04c","year":2025},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.109735Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:27ddf042b2772b1dd9fd91bc889c887bac876b89e5e6d596eba00bb14a9b0829","observation_id":"a2bd0708-bf91-4878-b984-d136dd20162c","resolution":{"observed_at":"2026-08-12T10:36:36.563962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 2 inbound Pith citation observations for arXiv:2411.19103."}