{"as_of":"2026-08-09T15:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9463bf39ebdd9c82daab16844f14bc59548f6e0b7972cd2803a63bd8f0c0f778","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:57:53.734445Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:35:31.361951Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T10:14:36.195938Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06298","snapshot_observed_at":"2026-08-07T12:35:31.361951Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24635","last_updated":"2025-05-30T14:25:45Z","snapshot_observed_at":"2026-08-08T01:24:45.634935Z","submitted_at":"2025-05-30T14:25:45Z","title":"Disentangling Language and Culture for Evaluating Multilingual Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.361951Z"},"links":{"cited_paper":"/paper/2502.06298","citing_paper":"/paper/2505.24635"},"observation_digest":"sha256:80f5d0e02e3a135b9e51b16703d4a02373765e3afd005a914e19f8074405ddff","observation_id":"db639b68-38c1-4584-87dd-41e5125fb336","resolution":{"observed_at":"2026-08-07T12:35:31.361951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"cited_work":{"arxiv_id":"2502.06298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06298","snapshot_observed_at":"2026-06-30T10:14:36.195938Z","title":"2502.06298 , archivePrefix=","venue":null,"work_id":"a0aa32b1-df8c-487e-a073-e17a44e6d853","year":null},"citing_paper":{"arxiv_id":"2606.28715","last_updated":"2026-06-27T03:44:00Z","snapshot_observed_at":"2026-08-07T02:52:16.765972Z","submitted_at":"2026-06-27T03:44:00Z","title":"SEATauBench: Adapting Tool-Agent-User Evaluation Into Low-Resource Southeast Asian Languages","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-30T10:12:45.090257Z"},"links":{"cited_paper":"/paper/2502.06298","citing_paper":"/paper/2606.28715"},"observation_digest":"sha256:21ea5fa6c53e8b17a92fb6b98387ddd94978163d376a43b7c2eddf5a11426d83","observation_id":"85887f63-adf8-4e4d-875a-20fe503a91f5","resolution":{"observed_at":"2026-06-30T10:14:36.197621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06298/citation-record","integrity":"/paper/2502.06298/integrity","json":"/paper/2502.06298/citation-record.json","paper":"/paper/2502.06298"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.03608","last_updated":"2024-04-04T17:31:32Z","snapshot_observed_at":"2026-08-03T21:30:50.348232Z","submitted_at":"2024-04-04T17:31:32Z","title":"Sailor: Open Language Models for South-East Asia","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03608","snapshot_observed_at":"2026-08-08T15:57:53.653020Z","title":"ArXiv:2404.03608 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.653020Z"},"links":{"cited_paper":"/paper/2404.03608","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:1cc8296de58d9f2aefd8cadf5498d9b76cc62af8ed4e528b3f9dd15b1a280500","observation_id":"1fba6bad-c1d8-415b-95bb-b4788f6e0c73","resolution":{"observed_at":"2026-08-08T15:57:53.653020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T15:57:53.656975Z","title":"ArXiv:2407.21783 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.656975Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:d8c1384dbf6af3d97d56df49453736f457e24f96e73e686c9d9015200fb06be6","observation_id":"d2201c71-6070-48e5-81bd-6d0c5e007e1e","resolution":{"observed_at":"2026-08-08T15:57:53.656975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-08T15:57:53.660916Z","title":"arXiv preprint arXiv:2404.04475","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.660916Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:4cedf02f7a0e9de5619932c4a7ee5082f9838d6ee29c799c3ad5c9de77257717","observation_id":"d06556c5-f0d9-43fc-86bf-36d016ae4cf4","resolution":{"observed_at":"2026-08-08T15:57:53.660916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-08T15:57:53.664955Z","title":"ArXiv:2406.12793 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.664955Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:e8f67029cc555f7973554ef1b1c179ce1fbd7180b3e81bb1f7a6480df6bcd528","observation_id":"4d5f4659-5a3c-4e58-9cb3-638d3a91b0a4","resolution":{"observed_at":"2026-08-08T15:57:53.664955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07004","last_updated":"2023-10-22T13:43:27Z","snapshot_observed_at":"2026-08-08T01:26:21.842000Z","submitted_at":"2023-05-11T17:44:17Z","title":"Not All Languages Are Created Equal in LLMs: Improving Multilingual Capability by Cross-Lingual-Thought Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07004","snapshot_observed_at":"2026-08-08T15:57:53.672568Z","title":"ArXiv:2305.07004 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.672568Z"},"links":{"cited_paper":"/paper/2305.07004","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:ea1144e3179528dc11b520d30d37b35a0c1b95f2f40d9435f0a4e1a17d305780","observation_id":"84945c91-ddf1-4e28-95c0-2ee6e97be30a","resolution":{"observed_at":"2026-08-08T15:57:53.672568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10936","last_updated":"2025-01-07T12:15:01Z","snapshot_observed_at":"2026-07-06T18:15:54.402568Z","submitted_at":"2024-05-17T17:47:39Z","title":"A Survey on Large Language Models with Multilingualism: Recent Advances and New Frontiers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10936","snapshot_observed_at":"2026-08-08T15:57:53.676634Z","title":"ArXiv:2405.10936 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.676634Z"},"links":{"cited_paper":"/paper/2405.10936","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:af43336ee168756bc6e07d19c2cba9838431ebe5222cd0af599b1f15c454e0fd","observation_id":"1d7ddba1-1f0f-4e6c-a15c-c4e34e35f74c","resolution":{"observed_at":"2026-08-08T15:57:53.676634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-08T15:57:53.680596Z","title":"ArXiv:2310.06825 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.680596Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:0e2918fcc6ec97759c8debe71cdc6c30877d9abfc05433b459f20c67a181c1ee","observation_id":"4233678b-572b-407e-8669-689c803917de","resolution":{"observed_at":"2026-08-08T15:57:53.680596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05613","last_updated":"2023-04-12T05:08:52Z","snapshot_observed_at":"2026-08-08T14:56:30.785142Z","submitted_at":"2023-04-12T05:08:52Z","title":"ChatGPT Beyond English: Towards a Comprehensive Evaluation of Large Language Models in Multilingual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05613","snapshot_observed_at":"2026-08-08T15:57:53.683952Z","title":"ArXiv:2304.05613 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.683952Z"},"links":{"cited_paper":"/paper/2304.05613","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:1b79dab2254a2a82b8670ca3163e095ec250d602fa06afae3cd53b1a7247a7ef","observation_id":"2be21d67-ecab-4335-9840-9de37aea88f2","resolution":{"observed_at":"2026-08-08T15:57:53.683952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-08T15:57:53.687493Z","title":"ArXiv:2406.11939 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.687493Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:0d89d241f9d37e8141916e0cc57ba8f09dfff2ae95edb1c13251f798f3b105d4","observation_id":"6b66c004-bba1-4d15-a1f2-a93348aa2b50","resolution":{"observed_at":"2026-08-08T15:57:53.687493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04770","last_updated":"2024-10-05T22:39:51Z","snapshot_observed_at":"2026-08-06T14:20:21.460707Z","submitted_at":"2024-06-07T09:15:44Z","title":"WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04770","snapshot_observed_at":"2026-08-08T15:57:53.691083Z","title":"ArXiv:2406.04770 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.691083Z"},"links":{"cited_paper":"/paper/2406.04770","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:113c1f3028b2f7895dbc9474bd8c4a2f3b99033148b223c75bd9df9db8b371ea","observation_id":"066afe2d-7b7e-4bfc-a3a2-bfe5989660d5","resolution":{"observed_at":"2026-08-08T15:57:53.691083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10258","last_updated":"2025-04-21T12:52:49Z","snapshot_observed_at":"2026-07-06T17:45:15.311629Z","submitted_at":"2024-03-15T12:47:39Z","title":"Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10258","snapshot_observed_at":"2026-08-08T15:57:53.694595Z","title":"ArXiv:2403.10258 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.694595Z"},"links":{"cited_paper":"/paper/2403.10258","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:3f692a33c52c77dadf139d31c300aa413feb7cb83a55cc58bbfac9a0ba1ab9bf","observation_id":"cec73c6e-b2f7-45f6-92da-f506fc3fd98e","resolution":{"observed_at":"2026-08-08T15:57:53.694595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10118","last_updated":"2025-03-11T02:04:36Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T15:23:39Z","title":"SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10118","snapshot_observed_at":"2026-08-08T15:57:53.698083Z","title":"ArXiv:2406.10118 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.698083Z"},"links":{"cited_paper":"/paper/2406.10118","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:27483f5b3c5f842d6aa608b58bcebd60d1f27a78ca749c2cf23828574d6fb4aa","observation_id":"31e23f35-18db-4354-8f4f-4901da865df8","resolution":{"observed_at":"2026-08-08T15:57:53.698083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00738","last_updated":"2024-07-01T05:52:31Z","snapshot_observed_at":"2026-07-06T16:55:45.402426Z","submitted_at":"2023-12-01T17:17:56Z","title":"SeaLLMs -- Large Language Models for Southeast Asia","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00738","snapshot_observed_at":"2026-08-08T15:57:53.701632Z","title":"ArXiv:2312.00738 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.701632Z"},"links":{"cited_paper":"/paper/2312.00738","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:9cb7e15365dce9c3f1d008ac7c8c69662c148d0f8cb8a1ab0499e3ea0ec81d1d","observation_id":"d4e32805-fc9e-41be-877a-a010c365033d","resolution":{"observed_at":"2026-08-08T15:57:53.701632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T15:57:53.705379Z","title":"ArXiv:2303.08774 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.705379Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:1e3810f20324aea70bec279b5165c4281360ce1612e9de8d1be5549f911f9414","observation_id":"f17dd090-94b8-4591-95fe-8829167c72fb","resolution":{"observed_at":"2026-08-08T15:57:53.705379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04925","last_updated":"2024-04-07T11:52:44Z","snapshot_observed_at":"2026-08-09T02:23:58.261214Z","submitted_at":"2024-04-07T11:52:44Z","title":"Multilingual Large Language Model: A Survey of Resources, Taxonomy and Frontiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04925","snapshot_observed_at":"2026-08-08T15:57:53.709076Z","title":"ArXiv:2404.04925 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.709076Z"},"links":{"cited_paper":"/paper/2404.04925","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:092bcf7155eda3450a5d9caccdd23e67d5d72beb2abb33329e6d40fe3ee1edad","observation_id":"dc4e8bb6-94e1-4ea8-b9ad-52d80770ca42","resolution":{"observed_at":"2026-08-08T15:57:53.709076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-08T15:57:53.716047Z","title":"ArXiv:2408.00118 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.716047Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:0470e74314abf61c3a31e26b20b20489119053e06f5a1aa5f3d9f6c20e6a6325","observation_id":"71a1e99b-ab90-4460-a9d6-258414d52ecf","resolution":{"observed_at":"2026-08-08T15:57:53.716047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04766","last_updated":"2024-07-11T04:01:41Z","snapshot_observed_at":"2026-08-04T20:31:33.281526Z","submitted_at":"2023-09-09T11:42:22Z","title":"SeaEval for Multilingual Foundation Models: From Cross-Lingual Alignment to Cultural Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04766","snapshot_observed_at":"2026-08-08T15:57:53.719725Z","title":"ArXiv:2309.04766 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.719725Z"},"links":{"cited_paper":"/paper/2309.04766","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:dbee9b5e168ae13697e0cfd5b2e11ab8368e0c3d72a01a9940eea4b89b3bbf17","observation_id":"126e4584-5d4f-46d2-b2ab-5b5ecc7e9029","resolution":{"observed_at":"2026-08-08T15:57:53.719725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T15:57:53.723180Z","title":"ArXiv:2407.10671 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.723180Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:694c81f7fab9c15678735aefa70f6092c0e6b227d8a2ac3a433b4311b06a1e86","observation_id":"811a771a-b6f4-4a47-ab5e-0ef39f32182e","resolution":{"observed_at":"2026-08-08T15:57:53.723180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05179","last_updated":"2023-11-10T04:11:01Z","snapshot_observed_at":"2026-07-06T15:40:16.429096Z","submitted_at":"2023-06-08T13:21:29Z","title":"M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05179","snapshot_observed_at":"2026-08-08T15:57:53.726650Z","title":"ArXiv:2306.05179 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.726650Z"},"links":{"cited_paper":"/paper/2306.05179","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:44d0bb4766290c18798c6f8d158a138c5f0c934ac47bcc78244ac9b37f6fc854","observation_id":"2dd5f617-5e2c-459c-a56f-1ba1820be171","resolution":{"observed_at":"2026-08-08T15:57:53.726650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19672","last_updated":"2024-07-29T03:26:22Z","snapshot_observed_at":"2026-08-08T01:31:18.364757Z","submitted_at":"2024-07-29T03:26:22Z","title":"SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19672","snapshot_observed_at":"2026-08-08T15:57:53.730210Z","title":"ArXiv:2407.19672 [cs]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.730210Z"},"links":{"cited_paper":"/paper/2407.19672","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:9383905db94b87b4291f989a5529473509355cfff94090d63aed6fdcbfdb4b68","observation_id":"b1265146-5025-4a62-9ade-7d01bbc92b3d","resolution":{"observed_at":"2026-08-08T15:57:53.730210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:57:53.981358Z","title":"The categorization follows the practice in M3Exam (Zhang et al., 2023)","venue":null,"work_id":"1d4b2636-682d-42d1-8d48-0f4cd980f330","year":2023},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.734445Z"},"links":{"citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:e02c0ce1aa818c7f9e17c1df02ef0a27931c6d333d446f489fd6cadc152cfcf0","observation_id":"5b32dc12-74e6-4fa0-a14c-4bbdb6dde627","resolution":{"observed_at":"2026-08-08T15:57:53.986362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:57:53.993841Z","title":"In Proceedings of the 2018 Conference on Empirical Methods in Nat- ural Language Processing, pages 2475–2485, Brus- sels, Belgium","venue":null,"work_id":"c4454228-26a7-4eea-8707-0e42359c2d95","year":2018},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.648649Z"},"links":{"citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:2ec75e0ac84f2ee1c970e2c382fedbaa436cddf769369463aa5cdbfeabaf42fb","observation_id":"d3cf97c9-a3d1-436d-bc0b-29966329a1a4","resolution":{"observed_at":"2026-08-08T15:57:53.998075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-08T15:57:53.668748Z","title":"ArXiv:2009.03300 [cs]","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.668748Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:0ec20e5fe557ca0f840f7e7d9723274e7464abf89ae23c1ded573b868c8c0968","observation_id":"f3654095-6c62-4dee-86dd-3e9d77811fd2","resolution":{"observed_at":"2026-08-08T15:57:53.668748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03057","last_updated":"2022-10-06T17:03:34Z","snapshot_observed_at":"2026-07-06T14:00:37.875054Z","submitted_at":"2022-10-06T17:03:34Z","title":"Language Models are Multilingual Chain-of-Thought Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03057","snapshot_observed_at":"2026-08-08T15:57:53.712567Z","title":"ArXiv:2210.03057 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.712567Z"},"links":{"cited_paper":"/paper/2210.03057","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:198466a936c9fa86ae6010b894aba39076104223950fb031cc21c03f0516d175","observation_id":"9fb5a892-f8a3-472e-8d93-226ed0e29ac1","resolution":{"observed_at":"2026-08-08T15:57:53.712567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:57:54.005059Z","title":"In Proceedings of the 2023 Conference on Empiri- cal Methods in Natural Language Processing , pages 4232–4267, Singapore","venue":null,"work_id":"394b1c9f-57a3-42f4-a4b4-4004f8f2626d","year":2023},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.639218Z"},"links":{"citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:7d0ad1d17650fab77baa83b0004831cf9ec079216b0494608b3a80a710a6869c","observation_id":"b89f303a-0c04-415f-8aea-e2d14b6bf51d","resolution":{"observed_at":"2026-08-08T15:57:54.008737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15032","last_updated":"2024-05-31T14:47:55Z","snapshot_observed_at":"2026-08-08T20:44:21.843324Z","submitted_at":"2024-05-23T20:10:38Z","title":"Aya 23: Open Weight Releases to Further Multilingual Progress","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15032","snapshot_observed_at":"2026-08-08T15:57:53.643963Z","title":"ArXiv:2405.15032 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T15:57:53.643963Z"},"links":{"cited_paper":"/paper/2405.15032","citing_paper":"/paper/2502.06298"},"observation_digest":"sha256:1d49eff2eb7080c4c174f9354fb37bff2d15e526ec407c247089855e037a4682","observation_id":"cacd0365-b2e3-4aa9-a438-c87297933b29","resolution":{"observed_at":"2026-08-08T15:57:53.643963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06298","last_updated":"2025-02-10T09:40:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T02:24:12.712576Z","submitted_at":"2025-02-10T09:40:25Z","title":"SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2502.06298."}