{"as_of":"2026-08-13T01:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c31cdef68a5d4fc4b58e527fe723ebc0ce884402f82c6b3caa76bc31172a50d","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:24:55.346219Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T13:02:08.000814Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"cited_work":{"arxiv_id":"2501.05122","doi":"10.48550/arxiv.2501.05122","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"923d95e7-40c7-494d-8dd6-8d896deeb3f6","year":2025},"citing_paper":{"arxiv_id":"2509.22123","last_updated":"2026-05-13T12:28:55Z","snapshot_observed_at":"2026-08-08T13:18:54.000166Z","submitted_at":"2025-09-26T09:46:13Z","title":"Multilingual Vision-Language Models, A Survey","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T13:02:08.000814Z"},"links":{"cited_paper":"/paper/2501.05122","citing_paper":"/paper/2509.22123"},"observation_digest":"sha256:644321beb7cf1030e35efbf97e283a0a65e569ad77cc90679c14fdb20fe4cecc","observation_id":"a0f1011e-582f-4b25-9c1e-8113f3340bc1","resolution":{"observed_at":"2026-05-18T13:02:37.104593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05122/citation-record","integrity":"/paper/2501.05122/integrity","json":"/paper/2501.05122/citation-record.json","paper":"/paper/2501.05122"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:24:55.838961Z","title":"For each plot type, we define 50 configurations, so we have 100 plots/images in total per language","venue":null,"work_id":"5cdd775a-a9e5-4a06-b8ff-33b14a5e21ee","year":null},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.336398Z"},"links":{"citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:e7dfe025f2cb2a0351f7d621ad6766003eda0cc5a53072260557ddc59a5fe857","observation_id":"3e32faa7-df27-4b2b-9f54-f23e698acd48","resolution":{"observed_at":"2026-08-10T21:24:55.844008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:24:55.822894Z","title":"This means the plots are iden- tical between languages except for the labels and some size adjustments caused by different word lengths","venue":null,"work_id":"51443a64-222e-451c-a179-41990e13687e","year":null},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.341357Z"},"links":{"citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:92aba2f008a57cae3538fe903b3476a92091102b950670ebdabdb1c2c4a114ed","observation_id":"276c26f8-09bb-4dfe-9cd7-ae61e4c14b67","resolution":{"observed_at":"2026-08-10T21:24:55.828262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7100.0100","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:24:55.586298Z","title":"Jesus und seine Anhänger","venue":null,"work_id":"d311425a-0ab7-44fe-b08e-fbe9034b5fcb","year":2024},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.346219Z"},"links":{"citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:5f0ed2ca7432c322e722aeeca60c89b735894d84dd3845c240ea1ca0bc27af52","observation_id":"b898a3aa-f317-4106-91e3-70e7fd06ccfa","resolution":{"observed_at":"2026-08-10T21:24:55.595514Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12683","last_updated":"2024-10-03T17:27:28Z","snapshot_observed_at":"2026-08-12T16:19:59.480990Z","submitted_at":"2023-12-20T00:49:52Z","title":"Turning English-centric LLMs Into Polyglots: How Much Multilinguality Is Needed?","version":2},"cited_work":{"arxiv_id":"2312.12683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.12683","snapshot_observed_at":"2026-08-10T21:24:55.737057Z","title":"Turning English-centric LLMs Into Polyglots: How Much Multilinguality Is Needed?","venue":"cs.CL","work_id":"db7c6497-8c1f-472d-8204-0aebb3547ce3","year":2023},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.278327Z"},"links":{"cited_paper":"/paper/2312.12683","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:812458c436b615bd14451724caba569f99e44b3a080e15d2fabf95398b5c51aa","observation_id":"06560a1d-b411-42f8-9e77-38c928e18b9a","resolution":{"observed_at":"2026-08-10T21:24:55.742867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-13T00:15:14.556734Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-10T21:24:55.283994Z","title":"Association for Computational Linguistics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.283994Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:63d66696317063fbe20044210333a4911e51047658b80cc7486eca725e5fc4a0","observation_id":"f92d8813-4d80-4a9c-8d90-f164870456a9","resolution":{"observed_at":"2026-08-10T21:24:55.283994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:24:55.885236Z","title":null,"venue":null,"work_id":"ab3f6642-a112-4674-aa64-d546f17d5db7","year":2024},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.290059Z"},"links":{"citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:57bb891dd75485389f3ce19cd5ed6714c355584596bce853a5bd6341bad3acf1","observation_id":"4eca25dc-6688-47e0-a4b3-60747d40ad31","resolution":{"observed_at":"2026-08-10T21:24:55.889977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T21:24:55.300176Z","title":"CoRR, abs/2403.05525","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.300176Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:5820b583896422a0f3692a1e49a93b16f7733336f0255b87efcc3ed1b0397048","observation_id":"b93514ec-8972-403e-b255-f4228bae9ff7","resolution":{"observed_at":"2026-08-10T21:24:55.300176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-10T21:24:55.315894Z","title":"CoRR, abs/2210.08402","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.315894Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:588da8702a372074722ac17583b7ebedce015d4ab8de971b6469220bcd93617f","observation_id":"eaeacd26-3eca-45e9-b94f-98c58ec765e9","resolution":{"observed_at":"2026-08-10T21:24:55.315894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:24:55.870716Z","title":"{HYPOTHESIS}","venue":null,"work_id":"f001810b-8927-43b9-9af2-a07c83406556","year":2015},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.326421Z"},"links":{"citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:7ac028f2aaefdf1997e1006b3451d602c2aa5feaf8589936c241eb8363ff486c","observation_id":"22ca5a9e-dcf3-4f6e-880a-5442aaa810a8","resolution":{"observed_at":"2026-08-10T21:24:55.875052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:24:55.854066Z","title":"Is the bar with label ’reward’ the biggest?","venue":null,"work_id":"df3ba559-d9df-4ba0-b9b6-76ab51655b69","year":2024},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.331345Z"},"links":{"citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:f6e4fa507f4d3b3af53de18e5dd2a81b7a25687e980f9925c3137914e50d5b41","observation_id":"ad6c79c3-6a62-482b-ae35-9ee51259e8e3","resolution":{"observed_at":"2026-08-10T21:24:55.858441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:24:55.901422Z","title":null,"venue":null,"work_id":"f26273f0-987b-4f52-815d-d2b42c279605","year":2016},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.273248Z"},"links":{"citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:2b1298863cade32da57363e8de48e3938f98d0d8ab400da8579ee7c422614d5c","observation_id":"e812483f-5df2-4e76-ae97-d49db2771f13","resolution":{"observed_at":"2026-08-10T21:24:55.906600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-10T21:24:55.251743Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.251743Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:2d60faadc8c91ca52493c847a681d9bfcd3c0c89839138f62ba9201af86e4ba6","observation_id":"84c7be4f-b9b1-4191-9eaa-743da73ef2cc","resolution":{"observed_at":"2026-08-10T21:24:55.251743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T21:24:55.262215Z","title":"arXiv:2005.14165 [cs]","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.262215Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:6b98e36d0d2164d774fb66703e4158be5913e47950326b19c19ebcf059f547c2","observation_id":"3dea7a07-6cc8-475b-8559-da2e0d245544","resolution":{"observed_at":"2026-08-10T21:24:55.262215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13238","last_updated":"2021-10-21T18:13:28Z","snapshot_observed_at":"2026-08-11T03:51:12.812942Z","submitted_at":"2021-09-28T16:51:38Z","title":"Visually Grounded Reasoning across Languages and Cultures","version":2},"cited_work":{"arxiv_id":"2109.13238","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.13238","snapshot_observed_at":"2026-08-10T21:24:55.695477Z","title":"Visually Grounded Reasoning across Languages and Cultures","venue":"cs.CL","work_id":"066ad74d-11e7-4bb2-b1bb-82cbe2e3b618","year":2021},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.295064Z"},"links":{"cited_paper":"/paper/2109.13238","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:c6a2ad85837df81fc43039d402006a52ae6aef2f3033e771ece93756c670990c","observation_id":"9f405877-2e1a-445b-a6e7-9f160b97b42e","resolution":{"observed_at":"2026-08-10T21:24:55.701780Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-10T21:24:55.267768Z","title":"CoRR, abs/2305.06500","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.267768Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:5ae66e045cfee73f4fe04471886e52ef72b12a21f533ddac5d86180fbcd2e636","observation_id":"c502639c-b6bc-4588-93bc-e0c06f1ac9f6","resolution":{"observed_at":"2026-08-10T21:24:55.267768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-10T21:24:55.257178Z","title":"CoRR, abs/2407.07726","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.257178Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:b519ba283e70abae1b964fa5f6efd37d1b873636a2723cf6dd299b978c050138","observation_id":"17486c87-5341-43ec-8051-6811eae74fea","resolution":{"observed_at":"2026-08-10T21:24:55.257178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-12T23:46:50.077288Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-10T21:24:55.310900Z","title":"Minesh Mathew, Dimosthenis Karatzas, and C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":2591,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.310900Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:497aa3ef6e4f78ac1deecaa5edd70a725dc4815ccb92da07221759ee87d3f209","observation_id":"65c202e4-0623-4608-a79f-c9f50c3d4afd","resolution":{"observed_at":"2026-08-10T21:24:55.310900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14818","last_updated":"2024-03-05T11:22:07Z","snapshot_observed_at":"2026-08-09T03:29:04.291294Z","submitted_at":"2024-02-22T18:59:58Z","title":"PALO: A Polyglot Large Multimodal Model for 5B People","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14818","snapshot_observed_at":"2026-08-10T21:24:55.305344Z","title":"Pan Lu, Swaroop Mishra, Tanglin Xia, Liang Qiu, Kai- Wei Chang, Song-Chun Zhu, Oyvind Tafjord, Peter Clark, and Ashwin Kalyan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":6786,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.305344Z"},"links":{"cited_paper":"/paper/2402.14818","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:10ca0cf6115014375e811e5cba3c8541bbf7688025605f3614cdb7ab6a3ab0e5","observation_id":"2e4bd84d-993a-4714-a4bb-80fe5fac43eb","resolution":{"observed_at":"2026-08-10T21:24:55.305344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-10T21:24:55.320742Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":7298,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.320742Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:d58ee5ce18b19d6795ec4b4dd04354d020b372880c9db8b94fa4122a97e796c2","observation_id":"9312fdd3-0392-476d-8d1d-d98ee9c4ae99","resolution":{"observed_at":"2026-08-10T21:24:55.320742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T21:15:34.882079Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2501.05122."}