{"as_of":"2026-08-20T06:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edaaac3c5734285d3a9039b70ae070d3e5fe8ed42931647d7a1653bb3bd8ef3d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:49:22.651869Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-12T13:06:07.673361Z","title":"Cvqa: Culturally-diverse multilin- gual visual question answering benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16508","last_updated":"2025-05-01T03:41:42Z","snapshot_observed_at":"2026-08-17T13:19:41.298933Z","submitted_at":"2024-11-25T15:44:42Z","title":"All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T13:06:07.673361Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2411.16508"},"observation_digest":"sha256:bc4b728511981d0576b0154b0184bde2e9ea07c823fe5f5d357029ebb9b9c1d7","observation_id":"79047972-252a-4eca-b38c-ed69d7866932","resolution":{"observed_at":"2026-08-12T13:06:07.673361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-11T19:10:57.451130Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07112","last_updated":"2024-12-10T01:57:17Z","snapshot_observed_at":"2026-08-18T02:19:48.874222Z","submitted_at":"2024-12-10T01:57:17Z","title":"Maya: An Instruction Finetuned Multilingual Multimodal Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T19:10:57.451130Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2412.07112"},"observation_digest":"sha256:a4d21abfe4eabbf6d207ad74a85f0caad120db10756e636c2c870615a3daea28","observation_id":"8c372f18-98a6-480a-841b-83496213dec2","resolution":{"observed_at":"2026-08-11T19:10:57.451130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-10T22:36:03.809020Z","title":"Cvqa: Culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01282","last_updated":"2025-01-02T14:42:37Z","snapshot_observed_at":"2026-08-15T22:25:54.905660Z","submitted_at":"2025-01-02T14:42:37Z","title":"CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:36:03.809020Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2501.01282"},"observation_digest":"sha256:314c146641fafe58de9dc7c7bca0f283bc8b955fd10298e94f2d96f1a1b6f67c","observation_id":"a91608e1-9925-42b6-a46b-87b2041d3e67","resolution":{"observed_at":"2026-08-10T22:36:03.809020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-10T21:24:55.310900Z","title":"Minesh Mathew, Dimosthenis Karatzas, and C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05122","last_updated":"2025-01-09T10:26:14Z","snapshot_observed_at":"2026-08-15T07:20:28.361346Z","submitted_at":"2025-01-09T10:26:14Z","title":"Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model","version":1},"reference_index":2591,"source":"pdf_text","source_observed_at":"2026-08-10T21:24:55.310900Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2501.05122"},"observation_digest":"sha256:bb716275780f283243363ffc7e03311310af6194fad27bff96b3a442cb1e8c37","observation_id":"65c202e4-0623-4608-a79f-c9f50c3d4afd","resolution":{"observed_at":"2026-08-10T21:24:55.310900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-08T17:16:19.303266Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05961","last_updated":"2025-09-03T09:08:03Z","snapshot_observed_at":"2026-08-17T20:05:09.825350Z","submitted_at":"2025-02-09T17:09:46Z","title":"The Human Labour of Data Work: Capturing Cultural Diversity through World Wide Dishes","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T17:16:19.303266Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2502.05961"},"observation_digest":"sha256:4c79ea3e818969cbea9b7928bdd879a6ae65d6b6c1f01f71112083ce5753485d","observation_id":"5820ac62-96ca-4345-8348-a0c35a8c8280","resolution":{"observed_at":"2026-08-08T17:16:19.303266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-08T12:44:39.564015Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07455","last_updated":"2025-02-11T10:57:12Z","snapshot_observed_at":"2026-08-18T16:32:39.658851Z","submitted_at":"2025-02-11T10:57:12Z","title":"RusCode: Russian Cultural Code Benchmark for Text-to-Image Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T12:44:39.564015Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2502.07455"},"observation_digest":"sha256:eb19ba20ea7825c26bc267ad936a97fc0009b0f4a9d4d2ad0c87c29ce4aea83e","observation_id":"31db25bd-bb54-4708-a346-29a4de1a48de","resolution":{"observed_at":"2026-08-08T12:44:39.564015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-15T21:49:22.651869Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08910","last_updated":"2025-05-15T04:24:06Z","snapshot_observed_at":"2026-08-19T22:47:34.664664Z","submitted_at":"2025-05-13T19:01:12Z","title":"Behind Maya: Building a Multilingual Vision Language Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:22.651869Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2505.08910"},"observation_digest":"sha256:342471bd7ea2c64f849913ac2323170bd432b3b0fe4d61a518787ec150bbfb52","observation_id":"47ede23a-17a3-4574-bb5f-669b1d7e3c49","resolution":{"observed_at":"2026-08-15T21:49:22.651869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-07T14:46:46.670649Z","title":"CVQA: Culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-13T16:17:34.753862Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:46.670649Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:d11464649064acf7135a841c6f13941d2430a3dd649df1d217e5b4e30474f976","observation_id":"9da75c24-78c1-4c9f-a009-e9e5cef09de6","resolution":{"observed_at":"2026-08-07T14:46:46.670649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-07T11:22:38.873716Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11073","last_updated":"2025-06-03T11:17:16Z","snapshot_observed_at":"2026-08-14T08:54:19.907581Z","submitted_at":"2025-06-03T11:17:16Z","title":"CLAIM: Mitigating Multilingual Object Hallucination in Large Vision-Language Models with Cross-Lingual Attention Intervention","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:22:38.873716Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2506.11073"},"observation_digest":"sha256:3dadb684d0a307e2760975d00355ff8f5e467ac78efcb0e91089dd22c7e289c4","observation_id":"8b9cd554-a0f1-4e01-b5c4-0f9776fba7a0","resolution":{"observed_at":"2026-08-07T11:22:38.873716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-07T00:42:23.308048Z","title":"In Extended Abstracts of the CHI Conference on Human Factors in Computing Systems, pages 1–9","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12936","last_updated":"2025-06-15T18:39:24Z","snapshot_observed_at":"2026-08-18T02:54:48.420181Z","submitted_at":"2025-06-15T18:39:24Z","title":"CliniDial: A Naturally Occurring Multimodal Dialogue Dataset for Team Reflection in Action During Clinical Operation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:42:23.308048Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2506.12936"},"observation_digest":"sha256:f61df89cec2311395404d36d7a3b119bd7610a954c6a3bdf73cac581e5f7daed","observation_id":"83d00571-df45-4872-9d45-ebc8ba62f3cd","resolution":{"observed_at":"2026-08-07T00:42:23.308048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-06T17:04:23.217835Z","title":"arXiv preprint arXiv:2406.05967","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11882","last_updated":"2025-07-16T03:49:41Z","snapshot_observed_at":"2026-08-19T12:56:18.359487Z","submitted_at":"2025-07-16T03:49:41Z","title":"Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:04:23.217835Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2507.11882"},"observation_digest":"sha256:cec2335aaaba0403ce0f5b1c22749d882d1c31b00ab5979ca40cca199e0ccffe","observation_id":"175b67bb-690d-458b-ad3e-bc16960eb334","resolution":{"observed_at":"2026-08-06T17:04:23.217835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-15T17:54:07.433172Z","title":"CVQA: Culturally-Diverse Multilingual Visual Question Answering Benchmark , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-18T22:28:03.630568Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.433172Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:dd5660cc165ff61bfba61ec623a0a8120882f907d8344d8dfe13a22349a4610f","observation_id":"29b33775-fc13-45a1-b809-616da9dad5de","resolution":{"observed_at":"2026-08-15T17:54:07.433172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-05T22:10:51.204793Z","title":"arXiv preprint arXiv:2406.05967","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.07414","last_updated":"2025-08-12T05:39:35Z","snapshot_observed_at":"2026-08-16T06:22:27.553649Z","submitted_at":"2025-08-10T16:24:11Z","title":"Grounding Multilingual Multimodal LLMs With Cultural Knowledge","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:51.204793Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2508.07414"},"observation_digest":"sha256:dfd249c22b30a5014932457f67003c31a4fdbab6f479ff9264abbb4eaa890857","observation_id":"9618a300-00c2-447a-aeaf-eb6c98d8ef6f","resolution":{"observed_at":"2026-08-05T22:10:51.204793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-05T22:10:08.200780Z","title":"Cvqa: Culturally-diverse multilingual visual ques- tion answering benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-19T03:33:04.948769Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.200780Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:80b193077639888b22392282800156a28ae98283ca32188f86099743f010f568","observation_id":"428e2e7d-8199-4a49-9c58-b2f70941b2a0","resolution":{"observed_at":"2026-08-05T22:10:08.200780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":"2406.05967","doi":"10.48550/arxiv.2406.05967","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Cvqa: Culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":"3e1f5791-c2cc-4d3a-bcd0-dc5eca7bd61b","year":2024},"citing_paper":{"arxiv_id":"2509.02949","last_updated":"2026-04-06T19:10:00Z","snapshot_observed_at":"2026-08-17T16:07:34.417123Z","submitted_at":"2025-09-03T02:26:48Z","title":"ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T20:03:26.144452Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2509.02949"},"observation_digest":"sha256:f1cd5e8188c7bba5ed3380fb4690dc0bf561b6d8e32da3896507772c2f92c4bf","observation_id":"91ecdc94-518b-434d-a4c6-ac1ebc6593d1","resolution":{"observed_at":"2026-05-18T20:06:50.173571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-04T11:21:57.622339Z","title":"CVQA: Culturally-diverse multilingual visual question answering benchmark.arXiv preprint arXiv:2406.05967,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05291","last_updated":"2026-05-27T02:09:31Z","snapshot_observed_at":"2026-08-13T14:50:11.272229Z","submitted_at":"2025-10-06T18:59:11Z","title":"Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T11:21:57.622339Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2510.05291"},"observation_digest":"sha256:8b103fed96d99f46ba9848ad40cd2068b768646317134650486eea614e131f5a","observation_id":"c044eadd-ccc8-4f7d-bbd6-d9eca4e12ad6","resolution":{"observed_at":"2026-08-04T11:21:57.622339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":"2406.05967","doi":"10.48550/arxiv.2406.05967","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Cvqa: Culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":"3e1f5791-c2cc-4d3a-bcd0-dc5eca7bd61b","year":2024},"citing_paper":{"arxiv_id":"2604.02406","last_updated":"2026-05-16T00:42:12Z","snapshot_observed_at":"2026-08-12T09:32:39.556916Z","submitted_at":"2026-04-02T17:17:12Z","title":"Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-13T20:59:52.448832Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2604.02406"},"observation_digest":"sha256:b87cba1fbedf3256620f35aa1225bfcd13e57418bcb49ce1089a45239df7cb64","observation_id":"b8b02e51-595f-48e4-9ff5-bbfe480b8c77","resolution":{"observed_at":"2026-05-13T21:03:19.995920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":"2406.05967","doi":"10.48550/arxiv.2406.05967","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Cvqa: Culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":"3e1f5791-c2cc-4d3a-bcd0-dc5eca7bd61b","year":2024},"citing_paper":{"arxiv_id":"2604.02406","last_updated":"2026-05-16T00:42:12Z","snapshot_observed_at":"2026-08-12T09:32:39.556916Z","submitted_at":"2026-04-02T17:17:12Z","title":"Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-21T10:35:39.269869Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2604.02406"},"observation_digest":"sha256:411da445f4cd5761b7efa384e78cd2e599bde4aa85f8f0d7d3f09da5021961ce","observation_id":"ed2ff688-0306-4f92-8ec3-2d0b41d5bb2a","resolution":{"observed_at":"2026-05-21T10:40:00.742039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":"2406.05967","doi":"10.48550/arxiv.2406.05967","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Cvqa: Culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":"3e1f5791-c2cc-4d3a-bcd0-dc5eca7bd61b","year":2024},"citing_paper":{"arxiv_id":"2605.06115","last_updated":"2026-05-08T03:43:00Z","snapshot_observed_at":"2026-08-19T13:53:51.745319Z","submitted_at":"2026-05-07T12:26:11Z","title":"CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T10:34:33.399684Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2605.06115"},"observation_digest":"sha256:ebbfdb07ad1c5c976ce88a7bfb4107a6e1468a505dbd8b4d03dca6022a2a28e1","observation_id":"463be97e-c7f1-4ac8-b42d-51fac10554f7","resolution":{"observed_at":"2026-05-11T20:01:08.858876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":"2406.05967","doi":"10.48550/arxiv.2406.05967","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Cvqa: Culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":"3e1f5791-c2cc-4d3a-bcd0-dc5eca7bd61b","year":2024},"citing_paper":{"arxiv_id":"2605.06115","last_updated":"2026-05-08T03:43:00Z","snapshot_observed_at":"2026-08-19T13:53:51.745319Z","submitted_at":"2026-05-07T12:26:11Z","title":"CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:23.895938Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2605.06115"},"observation_digest":"sha256:0ccaa901a0bd7418f71b6b93f2204cbd225cb2cdc5f106fa9e75f005599d8684","observation_id":"69095852-e8a9-4c98-859a-4f6d520332ff","resolution":{"observed_at":"2026-05-11T00:50:49.698921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":"2406.05967","doi":"10.48550/arxiv.2406.05967","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Cvqa: Culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":"3e1f5791-c2cc-4d3a-bcd0-dc5eca7bd61b","year":2024},"citing_paper":{"arxiv_id":"2607.02007","last_updated":"2026-07-02T10:43:06Z","snapshot_observed_at":"2026-08-17T15:45:56.105226Z","submitted_at":"2026-07-02T10:43:06Z","title":"EduArt: An educational-level benchmark for evaluating art history knowledge in large language models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-03T14:48:06.514693Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2607.02007"},"observation_digest":"sha256:88b8df2d8776fb3e5d7223a4e4a280bb90e875ffb63566c3f36ca3ffbabbf541","observation_id":"10c268a4-983b-4eed-9c71-46b3c1a7ae37","resolution":{"observed_at":"2026-07-03T14:48:32.252812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-11T00:28:29.511963Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07763","last_updated":"2026-08-07T21:01:14Z","snapshot_observed_at":"2026-08-17T01:38:26.412954Z","submitted_at":"2026-08-07T21:01:14Z","title":"Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T00:28:29.511963Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2608.07763"},"observation_digest":"sha256:ff4d040930e2fc0f4f2b9a219eae3948e7e408742d7d423934d7979609e24982","observation_id":"34d2eab2-c807-403d-a919-86b5c21fa622","resolution":{"observed_at":"2026-08-11T00:28:29.511963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-14T12:25:20.540281Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13385","last_updated":"2026-08-13T15:46:50Z","snapshot_observed_at":"2026-08-20T01:06:07.748213Z","submitted_at":"2026-08-13T15:46:50Z","title":"When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T12:25:20.540281Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2608.13385"},"observation_digest":"sha256:b5f7fb2462792ee78ae59f297a0239c7096b6f268481b9a19938ae3e2d6af1c0","observation_id":"f7681ec2-f2ad-47ef-8814-7fa80d1444a0","resolution":{"observed_at":"2026-08-14T12:25:20.540281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.05967/citation-record","integrity":"/paper/2406.05967/integrity","json":"/paper/2406.05967/citation-record.json","paper":"/paper/2406.05967"},"outbound":[],"paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T01:05:59.002203Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2406.05967."}