{"as_of":"2026-08-17T01:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34a237b08bb4061eb0b0ec30005f9670bb69268949aae0b0b5d589ceecbbc9db","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:07:22.583812Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:16:24.014998Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07346","snapshot_observed_at":"2026-08-06T18:48:30.633186Z","title":"Benchmax: A comprehensive multilingual evaluation suite for large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07274","last_updated":"2025-07-09T20:45:04Z","snapshot_observed_at":"2026-08-09T12:42:36.949284Z","submitted_at":"2025-07-09T20:45:04Z","title":"LinguaMark: Do Multimodal Models Speak Fairly? A Benchmark-Based Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:30.633186Z"},"links":{"cited_paper":"/paper/2502.07346","citing_paper":"/paper/2507.07274"},"observation_digest":"sha256:658a742397c7f02c225a4fee7aea0804d2e1d9fd59a397598485d040bc5a0c23","observation_id":"2b3083bb-29df-47a1-8522-a90132a8fb6a","resolution":{"observed_at":"2026-08-06T18:48:30.633186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07346","snapshot_observed_at":"2026-08-06T14:53:02.268714Z","title":"Benchmax: A comprehensive multilingual evaluation suite for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17476","last_updated":"2025-07-23T12:56:31Z","snapshot_observed_at":"2026-08-17T00:20:34.523261Z","submitted_at":"2025-07-23T12:56:31Z","title":"MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T14:53:02.268714Z"},"links":{"cited_paper":"/paper/2502.07346","citing_paper":"/paper/2507.17476"},"observation_digest":"sha256:9ff8808208e832746345d1ac25a392305fd71481bbd4c1c1bfc153f756a28807","observation_id":"c1ce3ef5-add6-418e-a613-e2fe26eca464","resolution":{"observed_at":"2026-08-06T14:53:02.268714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07346","doi":"10.48550/arxiv.2502.07346","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07346","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.07346 , year=","venue":"ArXiv.org","work_id":"598572df-4b4e-4eb7-8486-21345da1ee66","year":2025},"citing_paper":{"arxiv_id":"2604.13286","last_updated":"2026-04-14T20:26:34Z","snapshot_observed_at":"2026-08-11T03:54:08.421458Z","submitted_at":"2026-04-14T20:26:34Z","title":"English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:32.517020Z"},"links":{"cited_paper":"/paper/2502.07346","citing_paper":"/paper/2604.13286"},"observation_digest":"sha256:06f377f71e09630764acac3f91dd01484da722c7baccf11485f5b77e843caeac","observation_id":"98b06a8b-5a94-403e-9b1d-3900cf7dfc19","resolution":{"observed_at":"2026-05-11T11:11:01.375111Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07346","doi":"10.48550/arxiv.2502.07346","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07346","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.07346 , year=","venue":"ArXiv.org","work_id":"598572df-4b4e-4eb7-8486-21345da1ee66","year":2025},"citing_paper":{"arxiv_id":"2604.21593","last_updated":"2026-05-03T05:05:27Z","snapshot_observed_at":"2026-08-16T09:49:57.029547Z","submitted_at":"2026-04-23T12:19:14Z","title":"Language as a Latent Variable for Reasoning Optimization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-09T21:40:37.499246Z"},"links":{"cited_paper":"/paper/2502.07346","citing_paper":"/paper/2604.21593"},"observation_digest":"sha256:e6adecc57b409853b7162abe5255b7026240ae7668d45576ec8b14a3d3003033","observation_id":"c69e8098-2699-4e5d-bd2d-87dc53a3bfe6","resolution":{"observed_at":"2026-05-09T21:43:31.010611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07346","doi":"10.48550/arxiv.2502.07346","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07346","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.07346 , year=","venue":"ArXiv.org","work_id":"598572df-4b4e-4eb7-8486-21345da1ee66","year":2025},"citing_paper":{"arxiv_id":"2605.18083","last_updated":"2026-05-18T08:59:08Z","snapshot_observed_at":"2026-08-15T15:52:19.737316Z","submitted_at":"2026-05-18T08:59:08Z","title":"A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$\\Delta$ Integration into Upcycled MoE","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-20T11:09:22.027588Z"},"links":{"cited_paper":"/paper/2502.07346","citing_paper":"/paper/2605.18083"},"observation_digest":"sha256:099dab70faa6ef271fb15f5d451b92a5961d753e513e8263c26ba8b6c3d4ee0e","observation_id":"2d81cf49-6b9d-4525-941f-e5faccb86241","resolution":{"observed_at":"2026-05-20T11:13:13.601691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07346","doi":"10.48550/arxiv.2502.07346","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07346","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.07346 , year=","venue":"ArXiv.org","work_id":"598572df-4b4e-4eb7-8486-21345da1ee66","year":2025},"citing_paper":{"arxiv_id":"2605.30788","last_updated":"2026-05-29T03:25:32Z","snapshot_observed_at":"2026-07-06T23:40:03.151978Z","submitted_at":"2026-05-29T03:25:32Z","title":"XLGoBench: Detecting cross-lingual skill gaps with algorithmic tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.698518Z"},"links":{"cited_paper":"/paper/2502.07346","citing_paper":"/paper/2605.30788"},"observation_digest":"sha256:70ee776ed8dd832a5b8c15e2eb66f001ee46b58702688a243fc79f8711865841","observation_id":"be70c081-7c96-4f4a-966b-65516e0725b4","resolution":{"observed_at":"2026-06-28T23:12:46.542685Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07346","doi":"10.48550/arxiv.2502.07346","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07346","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.07346 , year=","venue":"ArXiv.org","work_id":"598572df-4b4e-4eb7-8486-21345da1ee66","year":2025},"citing_paper":{"arxiv_id":"2606.01464","last_updated":"2026-05-31T21:48:26Z","snapshot_observed_at":"2026-08-14T16:04:34.251696Z","submitted_at":"2026-05-31T21:48:26Z","title":"Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T17:04:19.035841Z"},"links":{"cited_paper":"/paper/2502.07346","citing_paper":"/paper/2606.01464"},"observation_digest":"sha256:adeff835e82eae24218385fc37bef1b9b3cecbcef82cdda148a63dd235d4554d","observation_id":"7c491e6e-40ca-4251-bd7a-d8ca2df05dbf","resolution":{"observed_at":"2026-07-01T21:26:14.317825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07346","doi":"10.48550/arxiv.2502.07346","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07346","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.07346 , year=","venue":"ArXiv.org","work_id":"598572df-4b4e-4eb7-8486-21345da1ee66","year":2025},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-08-10T19:13:02Z","snapshot_observed_at":"2026-08-14T23:09:31.705348Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2502.07346","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:7e0222bb4fb0d64ad3ec6b3bf0084dc5031563d1c60b6e98e7eb1a218090470f","observation_id":"a1f31fe5-d7ee-453f-811e-85a161d2a055","resolution":{"observed_at":"2026-07-03T05:57:41.665957Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07346","doi":"10.48550/arxiv.2502.07346","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07346","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.07346 , year=","venue":"ArXiv.org","work_id":"598572df-4b4e-4eb7-8486-21345da1ee66","year":2025},"citing_paper":{"arxiv_id":"2607.00664","last_updated":"2026-07-01T09:13:19Z","snapshot_observed_at":"2026-08-15T06:01:10.555666Z","submitted_at":"2026-07-01T09:13:19Z","title":"YOMI-Bench: A Benchmark for Evaluating Kanji Reading and Phonological Understanding of LLMs for Japanese","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-02T13:03:58.617626Z"},"links":{"cited_paper":"/paper/2502.07346","citing_paper":"/paper/2607.00664"},"observation_digest":"sha256:296a49b90c046ec6d15c44ecb2d19e4aa926237608803c2d8f280916b0c1aaab","observation_id":"07c97628-a356-420c-8293-a32ed2ce7af5","resolution":{"observed_at":"2026-07-02T13:06:58.463450Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07346","snapshot_observed_at":"2026-08-07T23:16:24.014998Z","title":"Benchmax: A comprehensive multilingual evaluation suite for large language models.arXiv preprint arXiv:2502.07346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05802","last_updated":"2026-08-06T09:37:49Z","snapshot_observed_at":"2026-08-16T07:53:34.734955Z","submitted_at":"2026-08-06T09:37:49Z","title":"On-Policy Delta Distillation for Multilingual Math Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:24.014998Z"},"links":{"cited_paper":"/paper/2502.07346","citing_paper":"/paper/2608.05802"},"observation_digest":"sha256:4c697fc4b895d440ee47df3d485464f66d925ddf7965d68157766e8b4825acc1","observation_id":"2c3cb28e-25ab-48d7-9d20-b437b9268347","resolution":{"observed_at":"2026-08-07T23:16:24.014998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07346/citation-record","integrity":"/paper/2502.07346/integrity","json":"/paper/2502.07346/citation-record.json","paper":"/paper/2502.07346"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.865242Z","title":null,"venue":null,"work_id":"adb5b17e-c275-49b5-9096-5bede0a29e37","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.532827Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:2644fc456d3863f621f19da4cbb2a02b82978f65918b43be0e7ec611de639aaf","observation_id":"6bad7a07-f3d3-4276-8e34-4d4720866751","resolution":{"observed_at":"2026-08-08T13:07:22.869526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.851726Z","title":null,"venue":null,"work_id":"c3a5a06f-9aea-4216-983b-3ecae4e0c13c","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.537052Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:f2464177bcf20c30b25a3172e376b1b2126dad1304aadf4f3ca67ac8978c6512","observation_id":"070528b1-f937-4358-8be3-459695ddc114","resolution":{"observed_at":"2026-08-08T13:07:22.856154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-08T13:07:22.484855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.484855Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:5a3aa1002217569e374690bbc1c7712abbc7b7c2feaaf0fcf108cec0ba8a3e06","observation_id":"aac82a55-4720-4532-8a7b-b42171e1d376","resolution":{"observed_at":"2026-08-08T13:07:22.484855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T13:07:22.490174Z","title":"Transac- tions of the Association for Computational Linguis- tics, 12:979–995","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.490174Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:b44138061bebc4fd5748a73b11ddc25fe09831a36e19730758cc83ec9fd05281","observation_id":"624aaf0c-b0ee-462c-9093-398c728096ba","resolution":{"observed_at":"2026-08-08T13:07:22.490174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.815524Z","title":"My final verdict is tie: [[A =B]]","venue":null,"work_id":"bca17aa1-6764-4824-91d8-d075e8322509","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.550021Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:d1c4c0b5dbf9ad1a9dfb7ab3f3ed7123c1d497c9d5f797dab6dfd3d564527046","observation_id":"9b88d08e-aafc-422f-87df-cdd1708cbdf9","resolution":{"observed_at":"2026-08-08T13:07:22.819910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.920735Z","title":"Matthew G","venue":null,"work_id":"f2f5d753-af66-4639-b515-4c35accb463e","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.509972Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:4b8c03265134e07988614251f8b7a692a24126d199305319ddd2b3d2e7cd90f2","observation_id":"a4d42ceb-2b0b-4e85-b988-23281d522e8a","resolution":{"observed_at":"2026-08-08T13:07:23.031823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14734","last_updated":"2025-01-26T10:48:44Z","snapshot_observed_at":"2026-08-16T14:07:45.421990Z","submitted_at":"2024-03-21T08:54:56Z","title":"A Survey of Neural Code Intelligence: Paradigms, Advances and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14734","snapshot_observed_at":"2026-08-08T13:07:22.518776Z","title":"arXiv preprint arXiv:2403.14734","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.518776Z"},"links":{"cited_paper":"/paper/2403.14734","citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:0dd23417be11aeca1c572070249aed923dd3ad5c351c023d2f253ed3bbf65fa4","observation_id":"d18993a2-f9e5-4663-85bb-420db724b482","resolution":{"observed_at":"2026-08-08T13:07:22.518776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.893067Z","title":"• Math Reasoning: We collect data from MGSM which evaluates the capability of LLM to solve math reasoning problems in multiple languages, focusing on grade-school level complexity","venue":null,"work_id":"69cd54ba-8572-4162-8049-2351fd5a7726","year":2023},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.523669Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:8be4319ab84ca309d060f61ee3c6f46d1d6f364d184398806f3e63f0300647be","observation_id":"8bd5eac4-15cb-40af-ba25-0d55dc898555","resolution":{"observed_at":"2026-08-08T13:07:22.897586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.878961Z","title":"No meaning preserved","venue":null,"work_id":"cee6e7ef-7abe-4c08-a60c-3290ad0870b5","year":2024},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.528201Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:2a1d694524668d922322b73bf3c25c5744e2489a54f3ca91d501eee9680b2383","observation_id":"35f4b71d-a579-4e97-b9de-8cf520d6aae8","resolution":{"observed_at":"2026-08-08T13:07:22.883215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.541468Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.541468Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:3eb13c4e37cc665e8ca2e4b4f4ecbbf4e8de249721d980015ecc59b4996b2b95","observation_id":"d45a9a21-cc8a-4118-87f9-a5e094932311","resolution":{"observed_at":"2026-08-08T13:07:22.541468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.829030Z","title":null,"venue":null,"work_id":"bf505add-de57-45d9-a71f-99ed4b0c812a","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.545806Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:b9cdbb57752f15234003db7d5a0a225f05676153bd985388b29244d42d701c92","observation_id":"834550b0-d84f-47fa-8369-4d6fb52ec470","resolution":{"observed_at":"2026-08-08T13:07:22.833364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.802234Z","title":"Only translate content in comments","venue":null,"work_id":"4dff93bd-66bf-4a4e-bffb-33fe72333f36","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.554614Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:c1fdc23851923c132d63f60a2b64b63f6212ed94ddd32097c9ff1f50b7b05682","observation_id":"6a3ea05d-745a-4c80-9b3e-83a085129ae4","resolution":{"observed_at":"2026-08-08T13:07:22.806511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.788011Z","title":null,"venue":null,"work_id":"ee6921b6-5c93-4635-af64-b03cc5a4ca76","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.558791Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:cf1926b253c47744372f0759e011422e0370fae0044a0b2c5496fa31f06736ae","observation_id":"ff84a29d-7a30-4665-b823-c939508723bb","resolution":{"observed_at":"2026-08-08T13:07:22.792627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.759122Z","title":"[User Message] {problem} Table 18: Prompt for translating the Function Completion task","venue":null,"work_id":"63188127-feac-44ca-aa19-4c694fa11f36","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.567140Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:d3292a5cf3ea6d19c9ad5a0bd960a601c98bcdc3ce65076fbaf0400a12ce0110","observation_id":"da4ae30e-9796-48d7-be0e-5c2e439d272b","resolution":{"observed_at":"2026-08-08T13:07:22.763692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.773344Z","title":null,"venue":null,"work_id":"47e93a47-1f8c-4176-bf89-bbc928a39e79","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.571547Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:54d36126a00255b73a24c0e5bf8f9cab74ae21cf300fee752a9d93b7f11d7d00","observation_id":"284da523-f5ba-415f-bd1d-927072ef8a45","resolution":{"observed_at":"2026-08-08T13:07:22.777716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.745835Z","title":null,"venue":null,"work_id":"c9b7741c-774c-49e8-8f9e-7aad6a07c074","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.575615Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:9c404cb74bd2f20035eec5b24e48d42491fb058e2b21edc01feba51c2e3d8637","observation_id":"4c444337-4224-458a-89da-5fec57dc72e1","resolution":{"observed_at":"2026-08-08T13:07:22.749983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.732064Z","title":null,"venue":null,"work_id":"4ee4ca93-dc81-4811-84aa-87ea2895d445","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.579653Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:a122975c6d3bce8462fed09fe7f2b85e643691af95ccad9639a59ebe7c1bf79e","observation_id":"7a4b0792-0b94-4a46-9023-9d2442ce5158","resolution":{"observed_at":"2026-08-08T13:07:22.736339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.716294Z","title":"[User Message] {problem} Table 19: Prompt for translating the Problem Solving task","venue":null,"work_id":"ffcab920-9031-4583-b01a-fd09fc6dc840","year":null},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.583812Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:22a137c00d1e2b49cc3ecb86cf30430c747ceda2bb417e23faa83dac62bcdd53","observation_id":"a13c286c-75c9-4541-bd1c-bfe471a1cc43","resolution":{"observed_at":"2026-08-08T13:07:22.722352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:07:22.906562Z","title":null,"venue":null,"work_id":"4c9caf0f-cfda-42b9-b519-7f0e2af4626d","year":2006},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.514539Z"},"links":{"citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:bfb5062086a0dcda24812785b9adebf1559e18a75c82a2f6c913ba70855d155e","observation_id":"c8c43b53-0973-4521-9224-e299b6f2c310","resolution":{"observed_at":"2026-08-08T13:07:22.910785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-08T13:07:22.473926Z","title":"In Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.473926Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:dba264e1ad5c20057aa0750301225363757469e50673b286d141aa65b92f956d","observation_id":"30b32b0b-17b8-47fc-b4bd-4c6e8eb92c36","resolution":{"observed_at":"2026-08-08T13:07:22.473926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-15T18:01:46.669862Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-08T13:07:22.494775Z","title":"In International Conference on Learning Representations (ICLR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.494775Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:b8eab8a41eb8c761125d958cfbb801c476b6e2d111d568724b7ef30b83226f57","observation_id":"1ee0ca38-c572-490d-9659-5dad7169772e","resolution":{"observed_at":"2026-08-08T13:07:22.494775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-16T07:06:07.822225Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-08T13:07:22.505427Z","title":"Advances in neural in- formation processing systems, 35:27730–27744","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.505427Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:fda86cf11ba922e3d4422928bc9db1ae8947c3d04271764f436ec78240069b1c","observation_id":"9bad54a6-ee1a-4694-843c-6ebc1b9cadd5","resolution":{"observed_at":"2026-08-08T13:07:22.505427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-08T13:07:22.499646Z","title":"In Proceedings of the 2023 Conference on Empirical Methods in Natural Lan- guage Processing: System Demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.499646Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:8f673c8e011e6fc160c60743683526c3475a432a47c253f6a27e74862b61178a","observation_id":"5e30f34c-278e-4466-bfaa-540fc3e6d816","resolution":{"observed_at":"2026-08-08T13:07:22.499646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-08T13:07:22.479919Z","title":"arXiv preprint arXiv:2412.19437","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T13:07:22.479919Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2502.07346"},"observation_digest":"sha256:2b86a6b6e8695641154674922d4f7366a26279248dca394ebdc221ae7c64cdea","observation_id":"bb3e6816-1878-451c-8c04-f8f4646b7cda","resolution":{"observed_at":"2026-08-08T13:07:22.479919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07346","last_updated":"2025-04-20T12:19:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T11:34:18.364818Z","submitted_at":"2025-02-11T08:17:19Z","title":"BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 10 inbound Pith citation observations for arXiv:2502.07346."}