{"as_of":"2026-08-18T05:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:533078af2b0bb152d4cb0e8f48b7373ac7105725267226a3a22e43d69ee5928c","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:49:51.633826Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01274/citation-record","integrity":"/paper/2508.01274/integrity","json":"/paper/2508.01274/citation-record.json","paper":"/paper/2508.01274"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T05:49:51.471076Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.471076Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:194eb6eb6a0630950c7fe5928ff32da96d4782513d5e952c14a8918dcce162f6","observation_id":"dc5a86d8-dd3d-48ca-a4c8-8cc0eb4a778d","resolution":{"observed_at":"2026-08-06T05:49:51.471076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-06T05:49:51.476645Z","title":"Dai, Orhan Firat, Melvin Johnson, Dmitry Lepikhin, Alexandre Passos, Siamak Shakeri, Emanuel Taropa, Paige Bailey, Zhifeng Chen, Eric Chu, Jonathan H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.476645Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:25ca33a0a54901676f62ad21b208f38d847f3076d6053ab32bca74f6b0b3b49c","observation_id":"7c3760e2-6b13-4238-9598-afa4c68ef494","resolution":{"observed_at":"2026-08-06T05:49:51.476645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T05:49:51.481291Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.481291Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:c134a8017fdc4e0209008044eb3ade78677a32d76e9d92bdb91e307bd7543306","observation_id":"954b39b7-564b-4757-a8f4-c23729d4b035","resolution":{"observed_at":"2026-08-06T05:49:51.481291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T05:49:51.486412Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.486412Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:46ef797bea7fc129a82ce0900f509df6c61d927f92fff570dc501378dd945941","observation_id":"8478b6f7-e84a-480a-9064-26039c21df75","resolution":{"observed_at":"2026-08-06T05:49:51.486412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-16T20:32:02.311755Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-08-06T05:49:51.490677Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.490677Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:0ee3498262a7f70d8839e30e525d0a54780fff755f3727802ae357e1f5386257","observation_id":"fa26fd49-b609-4ebc-bc3f-caa9c3ce5658","resolution":{"observed_at":"2026-08-06T05:49:51.490677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:51.494989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.494989Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:d18c7222acaf976de6d190410a212f624555adb37b0bf7014ea8d2517281e8a8","observation_id":"464b06ab-5ea6-4f0e-9008-c258dc984a71","resolution":{"observed_at":"2026-08-06T05:49:51.494989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T05:49:51.503929Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.503929Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:83710552c01eaf2aefc5a31173466c28c143e34ca50e40fd801530928dfb69c8","observation_id":"5f6d1483-0f00-4886-8580-df48b871d38b","resolution":{"observed_at":"2026-08-06T05:49:51.503929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08448","last_updated":"2023-10-02T15:22:42Z","snapshot_observed_at":"2026-08-16T15:00:22.759453Z","submitted_at":"2023-09-15T14:52:23Z","title":"Advancing the Evaluation of Traditional Chinese Language Models: Towards a Comprehensive Benchmark Suite","version":2},"cited_work":{"arxiv_id":"2309.08448","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.08448","snapshot_observed_at":"2026-08-06T05:49:52.307252Z","title":"Advancing the Evaluation of Traditional Chinese Language Models: Towards a Comprehensive Benchmark Suite","venue":"cs.CL","work_id":"43247a11-5ee0-426a-baa2-a77c137b3457","year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.507893Z"},"links":{"cited_paper":"/paper/2309.08448","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:1450cee99055d18df336d66c05d898f832ce6ca58bb44a1d85a9d1e207de1e90","observation_id":"2ca8ade5-cbda-499e-9b66-a7fee0937720","resolution":{"observed_at":"2026-08-06T05:49:52.312171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00127","last_updated":"2023-12-30T03:19:54Z","snapshot_observed_at":"2026-08-16T14:30:49.326314Z","submitted_at":"2023-12-30T03:19:54Z","title":"Pushing Boundaries: Exploring Zero Shot Object Classification with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2401.00127","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00127","snapshot_observed_at":"2026-08-06T05:49:52.290598Z","title":"Pushing Boundaries: Exploring Zero Shot Object Classification with Large Multimodal Models","venue":"cs.CV","work_id":"f6280bd7-8a70-4a3c-b260-01a5ca2d8572","year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.511885Z"},"links":{"cited_paper":"/paper/2401.00127","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:01e76ee3fc5db81646993d6e01e4b7118bebd44a1dadf51e7138184179eb047b","observation_id":"9abc9593-2302-40ae-9e90-8a2a30723b4a","resolution":{"observed_at":"2026-08-06T05:49:52.295911Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12792","last_updated":"2023-09-22T01:44:46Z","snapshot_observed_at":"2026-08-16T15:06:05.138765Z","submitted_at":"2023-08-24T13:47:16Z","title":"Sparks of Large Audio Models: A Survey and Outlook","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12792","snapshot_observed_at":"2026-08-06T05:49:51.515683Z","title":"Schuller","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.515683Z"},"links":{"cited_paper":"/paper/2308.12792","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:fdcb0fd9dc4276fa86e2d03e3c432378787fffc61dc02c23eb00b00f9f2cf55d","observation_id":"52fed0d3-eb66-4725-b249-4535076df960","resolution":{"observed_at":"2026-08-06T05:49:51.515683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-16T13:55:33.670920Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-06T05:49:51.519985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.519985Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:c4b5cb04c2f838f3ad9bfa5da00f325788a5a09719876b34ef798156a79ce974","observation_id":"94c8b40b-c7d3-4a27-8637-b0d0cda626e3","resolution":{"observed_at":"2026-08-06T05:49:51.519985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:51.523705Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.523705Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:e610cfe8cab5bd45f0b06a235dc4bec9d99c54c28692a941754980eb461aed00","observation_id":"4443a859-1e0a-4085-b415-398d5bf08a6e","resolution":{"observed_at":"2026-08-06T05:49:51.523705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:51.527589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.527589Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:f009963749a0c9f45368f8cbd2b7a9f06af88204fa2913596d4d27b52457b0ed","observation_id":"9dc37bcf-276c-4b5d-8840-87b530acbf19","resolution":{"observed_at":"2026-08-06T05:49:51.527589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-13T18:28:46.913210Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-06T05:49:51.532048Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.532048Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:6f8e5678f3d149ec1188d9db000e6023721bf19ef893131ddf90d0e7e19a43ab","observation_id":"0e151fc7-433a-4cbe-a98c-fea04d225d58","resolution":{"observed_at":"2026-08-06T05:49:51.532048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2758.36728","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:52.123656Z","title":null,"venue":null,"work_id":"cc79a564-c5cb-46d9-ae1d-540dcfba1f9e","year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.537137Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:00d80ed6351106d8f323f6b6ab59ac39e790d24b8f5c2ee3901e269bc4c3aaa3","observation_id":"c0061773-5485-4a23-ac3d-f3f2e8d5b07e","resolution":{"observed_at":"2026-08-06T05:49:52.129584Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T05:49:51.541245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.541245Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:458a2d8eb071ad060a44b60e822eb5759b5eb85fd6c0f22fef77321f1ec4cba4","observation_id":"f850a393-35f4-4544-9e8d-3016414b342a","resolution":{"observed_at":"2026-08-06T05:49:51.541245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-16T14:31:06.725017Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-06T05:49:51.545721Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.545721Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:89bb4671a4182bce6ce8f80cc83b91aa00af123302718f82575446e7f3ba22c4","observation_id":"2e351de5-1f16-41ee-ba07-365d0832fabb","resolution":{"observed_at":"2026-08-06T05:49:51.545721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:52.410227Z","title":null,"venue":null,"work_id":"1f804496-388c-43bb-8e05-431291067ffe","year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.549680Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:4c5b8d0ca9613771695361121839bb934f9359d73ba77c4afbfbd4c4d61a5d77","observation_id":"8e47b658-d696-4523-b3dd-705168a89a24","resolution":{"observed_at":"2026-08-06T05:49:52.413724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:51.553420Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.553420Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:48138a016dd0b41a099d19ca4db628aab9e47bc6af22cc3d545ba34b9ead5536","observation_id":"b60a8aef-585f-46c8-b57e-7e0c20c69c0d","resolution":{"observed_at":"2026-08-06T05:49:51.553420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-08-16T21:34:35.147772Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-06T05:49:51.557351Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.557351Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:bda8bb6777c1dda68d49d49d8b6cdeada3b954c14f069f48f28214006e967f5c","observation_id":"781239df-d54f-4db6-a466-e88b33e7efd7","resolution":{"observed_at":"2026-08-06T05:49:51.557351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T05:49:51.561890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.561890Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:cd89cd7b0ea0f678d16971b26539642b9062803a7e11d23a904a394e7e24183a","observation_id":"951980de-f011-4bca-999e-e6bf5f847499","resolution":{"observed_at":"2026-08-06T05:49:51.561890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T05:49:51.565299Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.565299Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:16b4f043213ea6fbc28f0cbce24195209830aa36fc8affa605141481b6104b10","observation_id":"4156e41e-bcd0-4c2d-a4d1-341cb8b40ca1","resolution":{"observed_at":"2026-08-06T05:49:51.565299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-16T23:32:22.645653Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T05:49:51.570094Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.570094Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:e1a6d213870b72db86e163ef5a9a22a7fe69526a31720ba4cece40cb4cee132e","observation_id":"2726712a-3e7d-4f50-8701-4b8e4e9825d3","resolution":{"observed_at":"2026-08-06T05:49:51.570094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-06T05:49:51.574197Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.574197Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:5996165b327a22c4e004793d971cf9591bce14ef03f3ca3e5b3080015b55f3f9","observation_id":"512dc07b-01b1-40b9-8aec-f52d171a6f9d","resolution":{"observed_at":"2026-08-06T05:49:51.574197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-06T05:49:51.577941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.577941Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:0d202c9264561801d48c192c29859285bd1195b586cfeb868b48d6e07e768672","observation_id":"baf34838-8818-4543-9f52-90c9110f8a37","resolution":{"observed_at":"2026-08-06T05:49:51.577941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01858","last_updated":"2024-07-11T14:41:14Z","snapshot_observed_at":"2026-08-17T12:13:15.694228Z","submitted_at":"2024-03-04T09:13:33Z","title":"An Improved Traditional Chinese Evaluation Suite for Foundation Model","version":3},"cited_work":{"arxiv_id":"2403.01858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01858","snapshot_observed_at":"2026-08-06T05:49:51.887967Z","title":"An Improved Traditional Chinese Evaluation Suite for Foundation Model","venue":"cs.CL","work_id":"7f4fa836-be04-4a9c-91a4-e341ac7fa138","year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.582399Z"},"links":{"cited_paper":"/paper/2403.01858","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:fc94e70e2fdc9d29141ce0fd1068eb9ee37b0da83105f8a6c9aec4d2605068f8","observation_id":"78135712-2999-478e-b7f1-745c2641a127","resolution":{"observed_at":"2026-08-06T05:49:51.893428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10427","last_updated":"2025-03-15T01:32:58Z","snapshot_observed_at":"2026-08-16T12:50:21.203258Z","submitted_at":"2025-03-13T14:49:35Z","title":"VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan","version":2},"cited_work":{"arxiv_id":"2503.10427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.10427","snapshot_observed_at":"2026-08-06T05:49:51.869072Z","title":"VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan","venue":"cs.CL","work_id":"a8985cf7-b94a-49ad-b9d4-3f8900730edb","year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.586304Z"},"links":{"cited_paper":"/paper/2503.10427","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:79597cd757ef9ab89ed804a51435983761a6a5f662df91630ece305896a4c72b","observation_id":"22ba5860-1755-499a-b8e8-de9e7eb105d0","resolution":{"observed_at":"2026-08-06T05:49:51.875346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:51.590032Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.590032Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:e6ba4d0fa631531c523e9ff39603287fae70c8b8b06a45fab1890cb2846eba8e","observation_id":"b1c98d8c-6bf4-4c85-8212-e1339376e2aa","resolution":{"observed_at":"2026-08-06T05:49:51.590032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T05:49:51.593351Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.593351Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:539ef519615152e7cf076585e37f92aaf1f16f58a5504bc44e21a9ff5a519eec","observation_id":"cfd6b74b-d94d-4395-a69f-30d8ace9b657","resolution":{"observed_at":"2026-08-06T05:49:51.593351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T05:49:51.597318Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.597318Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:ec2040ce379f35160bb4df438b893817aaf9401efee2e7e2d27118b552e012f4","observation_id":"ca80e7d3-91fb-4d44-af98-966e19321006","resolution":{"observed_at":"2026-08-06T05:49:51.597318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:52.390677Z","title":null,"venue":null,"work_id":"a179d837-27d4-45e6-8506-3b4b4a6369ea","year":null},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.601137Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:9b5e198eff10892648360dc3b8dc65dad6b1153701ce0635c2cc1e091f6f1305","observation_id":"7901e85c-568a-4313-bff0-1ac5f285c8a9","resolution":{"observed_at":"2026-08-06T05:49:52.394377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-17T09:50:53.260956Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-06T05:49:51.608775Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.608775Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:4eda7d8600a966afb61facc7f7d2883f33cd88cc5bf16aa5030179179e36c2c8","observation_id":"9d6818eb-e463-4cf5-8a03-e44237d8a785","resolution":{"observed_at":"2026-08-06T05:49:51.608775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T05:49:51.612343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.612343Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:d4d8c6534bf24d5a43d963df50a0e7a879bfeabe595fdfa6b5ffa907a82aa432","observation_id":"c471a939-5148-4b67-b08c-e653c1b02032","resolution":{"observed_at":"2026-08-06T05:49:51.612343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-08-17T02:24:20.015689Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-06T05:49:51.616635Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.616635Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:eaf271b422a29dcfe355b52da7596ff5281ef65cf2d7941b46611dc6c6e9ac19","observation_id":"ad72b08f-cd06-409b-a456-7baf9d73d505","resolution":{"observed_at":"2026-08-06T05:49:51.616635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T05:49:51.620971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.620971Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:d23e708c13f43cf3f8a96462fca371551d4832b7ff1e63fef7dd0a05722c5ee6","observation_id":"5f25729c-21ce-41dc-8e41-ff2e4d09c075","resolution":{"observed_at":"2026-08-06T05:49:51.620971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-06T05:49:51.625753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.625753Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:ba001be1f19b55c19b2c986909c2202db29a86a3863ef8c088beb4e8befc5c0a","observation_id":"e4a42ff3-5375-46fa-859f-e25a3a93e91e","resolution":{"observed_at":"2026-08-06T05:49:51.625753Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-08-16T14:17:18.108855Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-06T05:49:51.629751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.629751Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:7b4b3b3c7f561024988b7ce3a0efd01935eeee96d1da3897198b4f9b11f16bce","observation_id":"e19c2b0d-7237-4140-a787-c1e5cbbf9be9","resolution":{"observed_at":"2026-08-06T05:49:51.629751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-06T05:49:51.633826Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.633826Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:eccac278b37f9131b9d02719ed5a62cc99477db34c5a3077accdd40506dfa788","observation_id":"980b3d77-fb56-4d2b-95f1-4a89297c6834","resolution":{"observed_at":"2026-08-06T05:49:51.633826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T05:49:51.499143Z","title":"arXiv:2407.10759 [eess.AS] https://arxiv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.499143Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:0ca5744603b9d493e49305bebeaf1c77ce835a232d2d194d667536f1eef44672","observation_id":"99981462-a7fa-4aac-9aa8-99338b81a894","resolution":{"observed_at":"2026-08-06T05:49:51.499143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16508","last_updated":"2025-05-01T03:41:42Z","snapshot_observed_at":"2026-08-17T13:19:41.298933Z","submitted_at":"2024-11-25T15:44:42Z","title":"All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16508","snapshot_observed_at":"2026-08-06T05:49:51.605060Z","title":"arXiv:2411.16508 [cs.CV] https://arxiv.org/abs/2411.16508","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.605060Z"},"links":{"cited_paper":"/paper/2411.16508","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:1a2c0bad2ce96ffafe95bba234421cb4e9d072eb38acb6f08e6948c9bf6a1bb6","observation_id":"518f67d6-ad7f-485a-9f1a-34a293fbc990","resolution":{"observed_at":"2026-08-06T05:49:51.605060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T21:20:38.664743Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":34,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2508.01274."}