{"as_of":"2026-08-19T16:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c37846e126b2450b0347e3687e531ea8649b46832ade4ad7fa7b9c97036349d9","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:10:18.937297Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:28:03.594544Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T09:39:54.392252Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16125","snapshot_observed_at":"2026-08-06T17:28:03.594544Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10920","last_updated":"2025-07-15T02:26:47Z","snapshot_observed_at":"2026-08-17T12:33:16.681350Z","submitted_at":"2025-07-15T02:26:47Z","title":"HanjaBridge: Resolving Semantic Ambiguity in Korean LLMs via Hanja-Augmented Pre-Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:28:03.594544Z"},"links":{"cited_paper":"/paper/2505.16125","citing_paper":"/paper/2507.10920"},"observation_digest":"sha256:568a171dd282ee60786432cfe48508e24e7a217972e7aa91f5ccc192b2fe0e93","observation_id":"718795ec-14aa-4c83-93e0-9f634b776ed5","resolution":{"observed_at":"2026-08-06T17:28:03.594544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"cited_work":{"arxiv_id":"2505.16125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16125","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint","venue":null,"work_id":"42250b87-b980-47ef-a3c4-59346383cd3b","year":2025},"citing_paper":{"arxiv_id":"2603.15949","last_updated":"2026-04-30T18:15:42Z","snapshot_observed_at":"2026-08-11T03:36:50.643941Z","submitted_at":"2026-03-16T21:58:32Z","title":"BanglaSocialBench: A Benchmark for Evaluating Sociopragmatic and Cultural Alignment of LLMs in Bangladeshi Social Interaction","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T09:38:29.597205Z"},"links":{"cited_paper":"/paper/2505.16125","citing_paper":"/paper/2603.15949"},"observation_digest":"sha256:4be8c5850cee51a70d7780256288f30cd8319155cd3a1ed5e28bf7429a0aec7a","observation_id":"656a7e4d-8394-4154-b8f0-231d48098add","resolution":{"observed_at":"2026-05-15T09:39:54.394861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16125/citation-record","integrity":"/paper/2505.16125/integrity","json":"/paper/2505.16125/citation-record.json","paper":"/paper/2505.16125"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T15:10:12.530788Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:12.530788Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:06ff29872bc5ed71335cdcadd567c0ccc93ed3ddacf99f3fab7fbdeddd008871","observation_id":"d09e1769-c78d-4397-ab6a-66223b7e3020","resolution":{"observed_at":"2026-08-07T15:10:12.530788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:10:12.590589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:12.590589Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:8df06513c3530401157a004a271385df1f67312270e31cfaacaeda6807cba6cb","observation_id":"04a168de-7543-45ab-8a25-5d5d2e6d2240","resolution":{"observed_at":"2026-08-07T15:10:12.590589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:10:12.602073Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:12.602073Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:4382e44e6f0f012d08e62d3d6e08a7b3727d9812e0439bfb4867f494bf223d90","observation_id":"ea0cd3aa-d7e4-4a3d-82d5-ae817dd04642","resolution":{"observed_at":"2026-08-07T15:10:12.602073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T15:10:12.697859Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:12.697859Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:3f77885fd0f213eb1e35d0ffd8d0effcdda5dfed27d92818a7f07de3dd1fc7f5","observation_id":"fc996665-495f-4aa0-9fac-7725fb779284","resolution":{"observed_at":"2026-08-07T15:10:12.697859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.523859Z","title":null,"venue":null,"work_id":"083fe3bf-94d0-40a7-bc24-50fa2ce478bb","year":2019},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:12.840303Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:f2047164861ffbae78b149a9cd4756f9327bea11fd8d3f1349a8b6c873318f07","observation_id":"b232d927-0eaf-4de6-a479-afa29610c04f","resolution":{"observed_at":"2026-08-07T15:10:20.532713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:12.964354Z","title":"Holmes Recorder a benchmark to assess the linguistic competence of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:12.964354Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:7bc2d4a4b77b006a76c9de83a188971ee0b02bd1c9004c3451689fcfb4f0f0c6","observation_id":"d9523693-0231-4722-b725-bc6a7edab369","resolution":{"observed_at":"2026-08-07T15:10:12.964354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.491492Z","title":"Syntaxgym: An online platform for targeted evaluation of language models","venue":null,"work_id":"6a958152-f772-4c97-85af-9d9ee97a0b7b","year":2020},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:13.135458Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:3ef1651e709f70926d6fe80ce1af5f98bd40e0adebc3200fb205c62794e962cc","observation_id":"89ffbc7e-642f-43f6-a77d-60cca45f4cf9","resolution":{"observed_at":"2026-08-07T15:10:20.499389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12126","last_updated":"2024-09-18T16:51:02Z","snapshot_observed_at":"2026-08-16T17:40:56.339482Z","submitted_at":"2024-09-18T16:51:02Z","title":"Linguini: A benchmark for language-agnostic linguistic reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12126","snapshot_observed_at":"2026-08-07T15:10:13.254934Z","title":"Costa-jussà","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:13.254934Z"},"links":{"cited_paper":"/paper/2409.12126","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:57d62fa649ab8869a892c7c0b26c37930423d4a9f8b980ff91eab48b9e8d4f69","observation_id":"be8b3828-e619-47a5-a330-b72e87497b38","resolution":{"observed_at":"2026-08-07T15:10:13.254934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:13.361162Z","title":"Iolbench: Benchmarking llms on linguistic reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:13.361162Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:645379d3e7afd92260a42b9071b08095ad954f305d1fe01c69f7f2d307fbf14f","observation_id":"d9d1087e-4961-4f2f-85a1-30f6987d7bb2","resolution":{"observed_at":"2026-08-07T15:10:13.361162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06196","last_updated":"2024-10-31T10:14:49Z","snapshot_observed_at":"2026-08-17T14:47:38.160208Z","submitted_at":"2024-06-10T11:50:29Z","title":"LINGOLY: A Benchmark of Olympiad-Level Linguistic Reasoning Puzzles in Low-Resource and Extinct Languages","version":3},"cited_work":{"arxiv_id":"2406.06196","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06196","snapshot_observed_at":"2026-08-07T15:10:19.621819Z","title":"LINGOLY: A Benchmark of Olympiad-Level Linguistic Reasoning Puzzles in Low-Resource and Extinct Languages","venue":"cs.CL","work_id":"48e10c1c-bff9-45bb-80a1-ae34c3e1ee92","year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:13.474052Z"},"links":{"cited_paper":"/paper/2406.06196","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:c591857956c60de48b5533e7e12ea18c3042812e46cb58fcfe4213dc58a4ddba","observation_id":"a102fb66-db7c-48e0-be66-57460d022240","resolution":{"observed_at":"2026-08-07T15:10:19.679226Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:13.611956Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:13.611956Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:ce58f115348f7f262c0a1d5b5ce94cba09c2ab4d2bbb6a4c6cd3454de0b0cba0","observation_id":"d6f0e28a-a2e5-4511-9fba-4c3f5cc37021","resolution":{"observed_at":"2026-08-07T15:10:13.611956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00537","last_updated":"2020-02-13T00:28:00Z","snapshot_observed_at":"2026-08-17T22:08:45.245439Z","submitted_at":"2019-05-02T00:41:50Z","title":"SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00537","snapshot_observed_at":"2026-08-07T15:10:13.730046Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:13.730046Z"},"links":{"cited_paper":"/paper/1905.00537","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:c1925c68618f5dea6310ad8e552529564dbee5f36f77659ddb584b08deed66dc","observation_id":"dbc8975f-4a6e-48a3-a6a4-4eab4105c6d8","resolution":{"observed_at":"2026-08-07T15:10:13.730046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T15:10:13.903057Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:13.903057Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:5612af46ab6806671bb4149d4f0a5c687a60eeca1bc4f6edd2fa6a6d63443e09","observation_id":"ae80c1e2-4b98-4f5a-aa22-da12bf5c2dc9","resolution":{"observed_at":"2026-08-07T15:10:13.903057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-07T15:10:14.024926Z","title":"Brown, Adam Santoro, Aditya Gupta, Adri \\`a Garriga-Alonso, Agnieszka Kluska, Aitor Lewkowycz, Akshat Agarwal, Alethea Power, Alex Ray, Alex Warstadt, Alexander W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.024926Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:adbdfcec82beb6a251aff8983dafd060ec9b8f0ae8a762f12a24aa5826047554","observation_id":"74c689d1-1ff9-4eb4-91a3-d57cd9968a9e","resolution":{"observed_at":"2026-08-07T15:10:14.024926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.433745Z","title":"Pub: A pragmatics understanding benchmark for assessing llms’ pragmatics capabilities","venue":null,"work_id":"caccb679-ae1e-4a4b-a032-36c21b96020b","year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.103530Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:04240d5708641424f18f04b554488d426553facaf99d0bef382f0d7c25f14d7f","observation_id":"fb230159-194c-48a0-9f08-bc10033b3ba5","resolution":{"observed_at":"2026-08-07T15:10:20.443047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07736","last_updated":"2024-09-30T09:49:08Z","snapshot_observed_at":"2026-08-16T13:43:59.069461Z","submitted_at":"2024-06-11T21:46:03Z","title":"MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07736","snapshot_observed_at":"2026-08-07T15:10:14.195846Z","title":"Multiprageval: Multilingual pragmatic evaluation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.195846Z"},"links":{"cited_paper":"/paper/2406.07736","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:6226c2de735f96939597fcc1343c7e4fe01e6efd30928f8bc68b3e4d75ed46a7","observation_id":"17042f30-904b-4c36-8644-9601ce4f5356","resolution":{"observed_at":"2026-08-07T15:10:14.195846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02456","last_updated":"2024-04-05T04:55:24Z","snapshot_observed_at":"2026-08-16T14:04:05.244446Z","submitted_at":"2024-04-03T04:53:14Z","title":"PhonologyBench: Evaluating Phonological Skills of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02456","snapshot_observed_at":"2026-08-07T15:10:14.314620Z","title":"Phonologybench: Evaluating phonological skills of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.314620Z"},"links":{"cited_paper":"/paper/2404.02456","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:9e3b13589fd698c74c04d4742656dba079ebd20ee0dc949c146a60b3e6467c63","observation_id":"ae376289-562c-45e4-970e-5b4f00c83c8c","resolution":{"observed_at":"2026-08-07T15:10:14.314620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09680","last_updated":"2021-11-02T15:36:39Z","snapshot_observed_at":"2026-08-19T06:44:47.488989Z","submitted_at":"2021-05-20T11:40:30Z","title":"KLUE: Korean Language Understanding Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09680","snapshot_observed_at":"2026-08-07T15:10:14.396034Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.396034Z"},"links":{"cited_paper":"/paper/2105.09680","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:c15d394ef2012420e948e16e490ec2729a78a56eecc3e1b5fb68886e7153d89e","observation_id":"e4bdb0c9-e6ce-4a8a-a1f9-a4360de2a64e","resolution":{"observed_at":"2026-08-07T15:10:14.396034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20574","last_updated":"2024-08-17T03:45:25Z","snapshot_observed_at":"2026-08-19T05:44:11.991446Z","submitted_at":"2024-05-31T02:05:45Z","title":"Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20574","snapshot_observed_at":"2026-08-07T15:10:14.473160Z","title":"Open ko-llm leaderboard: Evaluating large language models in korean with ko-h5 benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.473160Z"},"links":{"cited_paper":"/paper/2405.20574","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:334cb1a73c8269a41555b63697884491984efe4f7c9ff945002461cd05c2277d","observation_id":"4298c0aa-d7b4-494f-bc30-3e688b699902","resolution":{"observed_at":"2026-08-07T15:10:14.473160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.398317Z","title":"K o BEST : K orean balanced evaluation of significant tasks","venue":null,"work_id":"9697bdde-48d8-4530-9301-3a22f1f408ce","year":2022},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.590704Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:e879fc3731162e40badf9e278d09c1a4d8606c9361c38d884d6de52b0f7dc00e","observation_id":"09125917-6f0b-42dd-aa1a-025f43e66566","resolution":{"observed_at":"2026-08-07T15:10:20.413853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.364726Z","title":"HAE - RAE bench: Evaluation of K orean knowledge in language models","venue":null,"work_id":"e4ffd739-047a-4421-be27-c6e0ae145b5b","year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.718539Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:d119bbdae1e3813ec5b7567e4ed304e12197ec54573dd5e2e01aa4eddb18a40f","observation_id":"78f336cc-f88a-4412-bfcf-c35222234bfb","resolution":{"observed_at":"2026-08-07T15:10:20.372281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.338294Z","title":"CLI c K : A benchmark dataset of cultural and linguistic intelligence in K orean","venue":null,"work_id":"499e4711-3449-433d-8f6a-11c740c39a61","year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.803387Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:19ac6c51f8fffaa4e70931aad47077df72440643fa7a76ff0e0c91233dae5656","observation_id":"39232473-5816-4950-be63-5103f5a0a70d","resolution":{"observed_at":"2026-08-07T15:10:20.345710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:10:14.853180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.853180Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:2540331856e85eff8b9cd91c0665e08c28b717d55a9484fbb9f91ac1aa449d2d","observation_id":"35e96e00-2ba7-45ae-822e-e26d5dd8ac7f","resolution":{"observed_at":"2026-08-07T15:10:14.853180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T15:10:14.966529Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:14.966529Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:38727225960f62e3cf56c002b16e4752a652bd1e378c6cfbe950e69cf740b54c","observation_id":"4ebaf431-d609-497d-81ba-1adec09bfda9","resolution":{"observed_at":"2026-08-07T15:10:14.966529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.308617Z","title":"Mistral small 3.1, 2025","venue":null,"work_id":"bb73ca82-2b83-42e0-a1d6-f3603dba87d8","year":2025},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:15.140331Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:afd0d57dbaea204df4f1e627583bce48ce99ca4ab787ee2454c982ca791129b6","observation_id":"5e5b084c-f3d3-4eca-82b2-e8052c8a1a06","resolution":{"observed_at":"2026-08-07T15:10:20.323052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T15:10:15.220977Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:15.220977Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:87dda4178da0f51da63f051cb91feea79259e887caffbbaa9113b3c21e762ac6","observation_id":"dafbaa34-a0d9-4c14-b483-e3b301200010","resolution":{"observed_at":"2026-08-07T15:10:15.220977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T15:10:15.318958Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:15.318958Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:55ea7ae1518140844133eaa416efb5ae17b5052dd9745c690830182a8619b940","observation_id":"049f3b0d-f3ff-4a0d-b86c-327511addd75","resolution":{"observed_at":"2026-08-07T15:10:15.318958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:10:15.388040Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:15.388040Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:55d52ddf93acbec687157c4c2029d8f9dba0fd66430fddce6ef51a725381e40c","observation_id":"48ee745a-4605-4fe7-b3c2-d0be1828dc62","resolution":{"observed_at":"2026-08-07T15:10:15.388040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04261","last_updated":"2024-12-05T15:41:06Z","snapshot_observed_at":"2026-08-13T14:49:22.470549Z","submitted_at":"2024-12-05T15:41:06Z","title":"Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04261","snapshot_observed_at":"2026-08-07T15:10:15.554873Z","title":"Aya expanse: Combining research breakthroughs for a new multilingual frontier, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:15.554873Z"},"links":{"cited_paper":"/paper/2412.04261","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:545218347780bfaad7362340e9246714db0ca9b8753654cd5d939bf58f3707a0","observation_id":"ca64d69b-562e-4669-af73-72796e5b2478","resolution":{"observed_at":"2026-08-07T15:10:15.554873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:20.147628Z","title":"Claude 3.5 sonnet, 2024","venue":null,"work_id":"333160d3-630a-4205-85ce-1b917dd5da21","year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:17.270321Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:20a013847592af8584783b6a4c5a9e501a8f00946fcb06f683dcadd72b77c793","observation_id":"f7796360-c9fd-4f7a-8d14-b757aeced216","resolution":{"observed_at":"2026-08-07T15:10:20.223974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:19.939406Z","title":"Claude 3.7 sonnet, 2025","venue":null,"work_id":"32105bc1-5f3d-4ef9-9d3f-3f955ac2d0b5","year":2025},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:18.315796Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:55ad08fedbca29a6e324ec81b03f304cd1681200cc61418806bb706b3e4ff81a","observation_id":"d8ead1df-48dc-47f6-810d-302f1513e76c","resolution":{"observed_at":"2026-08-07T15:10:20.051466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00698","last_updated":"2025-04-14T12:37:51Z","snapshot_observed_at":"2026-08-17T05:47:31.276123Z","submitted_at":"2025-04-01T12:08:07Z","title":"Command A: An Enterprise-Ready Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00698","snapshot_observed_at":"2026-08-07T15:10:18.443678Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:18.443678Z"},"links":{"cited_paper":"/paper/2504.00698","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:1e43e9440481510b226fe882731e7b7fb807c43e3d8b43e3df5deddf97ff7e3d","observation_id":"27b4b4dd-739d-448c-a43a-8cb83dc50de8","resolution":{"observed_at":"2026-08-07T15:10:18.443678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:10:18.557472Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:18.557472Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:3d1ed4f42a6435e049252f1f359ee3b9aa5c733975fb265295684f63e8c0e5e6","observation_id":"b2ed16ec-f54d-48c7-9cf4-e2674101cbce","resolution":{"observed_at":"2026-08-07T15:10:18.557472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-07T15:10:18.644197Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:18.644197Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:0b3abd1debe87c3f1fd0608732979a15698fba4668d18e3cebec348c960da527","observation_id":"c234c631-4ec7-4a6e-ab0b-a7ba9a6b34f5","resolution":{"observed_at":"2026-08-07T15:10:18.644197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:18.747732Z","title":"Dissecting human and LLM preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:18.747732Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:6389ee0c171612fa839412513b3a9541e4908bc3026422278b7b355b28f49dc0","observation_id":"b6fea1fb-d494-4cb3-90fa-606d102a79b7","resolution":{"observed_at":"2026-08-07T15:10:18.747732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:18.890327Z","title":"Uncovering factor level preferences to improve human-model alignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:18.890327Z"},"links":{"citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:836ea507fe499ae9543a99be3d27d39875ebbd217514d7dc0737f75bd302fdc0","observation_id":"6e9a150b-4351-4986-8eb0-f49e26e01edd","resolution":{"observed_at":"2026-08-07T15:10:18.890327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16349","last_updated":"2024-01-16T16:51:33Z","snapshot_observed_at":"2026-08-16T14:56:53.422613Z","submitted_at":"2023-09-28T11:18:20Z","title":"Human Feedback is not Gold Standard","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16349","snapshot_observed_at":"2026-08-07T15:10:18.937297Z","title":"Human feedback is not gold standard, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:10:18.937297Z"},"links":{"cited_paper":"/paper/2309.16349","citing_paper":"/paper/2505.16125"},"observation_digest":"sha256:bcb07188be57cd08d857d3817b69c30704641425a2abfea7ba84a548ee7dc3fa","observation_id":"af71041c-2a60-4759-af02-fc7b4135293b","resolution":{"observed_at":"2026-08-07T15:10:18.937297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16125","last_updated":"2025-05-22T02:03:07Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T12:31:53.579248Z","submitted_at":"2025-05-22T02:03:07Z","title":"KoBALT: Korean Benchmark For Advanced Linguistic Tasks"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2505.16125."}