{"as_of":"2026-08-21T16:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:199502d86d451fcf286d76b419696ef902862fe1a5db836dbccaef98991cbaf0","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:50:25.827128Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:55:11.855633Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T15:25:49.002359Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00559","snapshot_observed_at":"2026-08-15T23:55:11.855633Z","title":"Arastem: A native arabic multiple choice question benchmark for evaluating llms knowledge in stem subjects, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03427","last_updated":"2025-08-22T11:58:27Z","snapshot_observed_at":"2026-08-19T05:45:47.393386Z","submitted_at":"2025-05-06T11:07:26Z","title":"MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T23:55:11.855633Z"},"links":{"cited_paper":"/paper/2501.00559","citing_paper":"/paper/2505.03427"},"observation_digest":"sha256:010e8ee39ebf565d8f6f88a9f9d1f60e7c0033d808a741ed41b031c2ec40a7c2","observation_id":"ed6f077c-0ebe-4b4b-927f-6ba65d56b2f5","resolution":{"observed_at":"2026-08-15T23:55:11.855633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00559","snapshot_observed_at":"2026-08-07T14:55:25.382481Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17021","last_updated":"2025-05-22T17:59:58Z","snapshot_observed_at":"2026-08-18T03:20:54.372856Z","submitted_at":"2025-05-22T17:59:58Z","title":"ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.382481Z"},"links":{"cited_paper":"/paper/2501.00559","citing_paper":"/paper/2505.17021"},"observation_digest":"sha256:54ef44c822c1ad63f7696fd9ea147addbf2ed25b760b64653c24002409ac2ac7","observation_id":"262647ab-2064-4ced-94fe-dab5a64ec751","resolution":{"observed_at":"2026-08-07T14:55:25.382481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00559","snapshot_observed_at":"2026-08-07T11:34:50.648503Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01920","last_updated":"2025-06-02T17:39:50Z","snapshot_observed_at":"2026-08-13T14:50:56.110277Z","submitted_at":"2025-06-02T17:39:50Z","title":"From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:34:50.648503Z"},"links":{"cited_paper":"/paper/2501.00559","citing_paper":"/paper/2506.01920"},"observation_digest":"sha256:d6bc10848a22b1131c6cc6da6e44040ab4f57977f409f6327b54bce746e1b997","observation_id":"511f2e6c-ad49-4129-b0e6-ca653a0abae8","resolution":{"observed_at":"2026-08-07T11:34:50.648503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"cited_work":{"arxiv_id":"2501.00559","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00559","snapshot_observed_at":"2026-08-06T15:25:49.002359Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","venue":"cs.CL","work_id":"9e91b38e-1b46-420e-9598-52cf148a5bff","year":2024},"citing_paper":{"arxiv_id":"2507.15850","last_updated":"2025-07-25T12:36:12Z","snapshot_observed_at":"2026-08-19T05:48:42.080307Z","submitted_at":"2025-07-21T17:58:27Z","title":"3LM: Bridging Arabic, STEM, and Code through Benchmarking","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:48.963935Z"},"links":{"cited_paper":"/paper/2501.00559","citing_paper":"/paper/2507.15850"},"observation_digest":"sha256:62ee285ed2cc2a284cfdd0ab55cf670a516315cf31dc969af37307e03f8e8876","observation_id":"b1ff8792-e50f-4d4f-b47d-4e555fa3cdb5","resolution":{"observed_at":"2026-08-06T15:25:49.007226Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00559/citation-record","integrity":"/paper/2501.00559/integrity","json":"/paper/2501.00559/citation-record.json","paper":"/paper/2501.00559"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.389635Z","title":"Crosslingual generalization through multitask finetuning,","venue":null,"work_id":"6e8b5916-dc53-447c-9d57-358b56f58582","year":2022},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.673674Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:719a6a341573253b00cf1f125e437038fb37e5ba07dc4e5883f193632db1ca25","observation_id":"8f7fa140-edc8-4c4f-b6e8-3a8e43a81bb3","resolution":{"observed_at":"2026-08-10T22:50:26.394761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.377370Z","title":"Aya dataset: An open-access collection for multilingual in- struction tuning,","venue":null,"work_id":"6246b400-cf2f-4a9c-8a41-a85b1dc683d1","year":2024},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.678874Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:f715c533159d895c4f6be6bbeff28024bb32913517dca14b7258db30a3b82807","observation_id":"25c9595b-51ce-4554-a64a-e500223d17df","resolution":{"observed_at":"2026-08-10T22:50:26.381517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.361866Z","title":"Jais and jais-chat: Arabic-centric foundation and instruction-tuned open generative large language models,","venue":null,"work_id":"a29a2933-25e5-414b-9a22-69e140a9e0b0","year":2023},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.684961Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:03ae0cd0c777ff1a9cd5e2dd3dd0fc16525b200ef4b6bd38c60efab3f324ac29","observation_id":"4cad6f03-d6fc-4890-ba00-bedd0ce602f6","resolution":{"observed_at":"2026-08-10T22:50:26.368550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.346745Z","title":"Mea- suring massive multitask language understand- ing,","venue":null,"work_id":"526b9666-15ec-4a5f-b929-bcd3be0d80c3","year":2020},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.694090Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:54e94264f7acdd7aa95a258406009224b875528f6da1897dcc8c6a8c0c50b131","observation_id":"251e5570-fbc0-489e-82cd-bbc1941ff4b7","resolution":{"observed_at":"2026-08-10T22:50:26.351593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.332093Z","title":"Hellaswag: Can a machine really finish your sentence?,","venue":null,"work_id":"5f5aa913-76ac-4e8a-bc56-0b1d54f56aa3","year":2019},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.701107Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:2172d3f375fe3eabe6966480d563893e813c54ab1d55092061fcdf5a9911cba5","observation_id":"20ebc0df-5dda-4e6d-8263-aad8bdb623b0","resolution":{"observed_at":"2026-08-10T22:50:26.336484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.307790Z","title":"Winogrande: An adversarial winograd schema challenge at scale,","venue":null,"work_id":"3730dd3d-7575-46b2-84e2-b65f089d6fc5","year":2019},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.708748Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:e1376fd92b69f3853cc0d8ba790441e4e1c1d51aeb90075934df10d2e2a0d1fc","observation_id":"9a893492-2b8a-4cf8-ad6b-b0c78a24e1fe","resolution":{"observed_at":"2026-08-10T22:50:26.320322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.292546Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":"9977f149-b342-4ef6-80cb-052552fca9ec","year":2023},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.715834Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:6e169fb1669db3e9f33c41ad5b9daa333d2cf79c679b9ef49a89ad454ef0c4fd","observation_id":"e90c6536-dfc4-48b7-a21f-c3536e41cdcb","resolution":{"observed_at":"2026-08-10T22:50:26.297264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.276005Z","title":"Measuring mathematical problem solving with the math dataset,","venue":null,"work_id":"cae6b16e-f997-4b29-8df1-1da5dce376f8","year":2021},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.722543Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:3b51688f7490f75e495305991120c19654432a6fae6f9e7ffb0478e81ee3d975","observation_id":"1e07d139-2196-48e8-bbed-7e26c84602b7","resolution":{"observed_at":"2026-08-10T22:50:26.281207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.256285Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them,","venue":null,"work_id":"a96ab4a5-f3d1-43bd-b2de-853bd8a68def","year":2022},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.727060Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:70de6a331cc4e1430e1ddacb67c0298027f8c2d53bb4150dd0e370ae540a67d7","observation_id":"fa3d8a6c-9d9f-4f0c-b4a1-c51cd64e3d30","resolution":{"observed_at":"2026-08-10T22:50:26.262895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.226597Z","title":"Drop: A read- ing comprehension benchmark requiring discrete reasoning over paragraphs,","venue":null,"work_id":"e38a632e-d2fb-463a-a5f1-5110fa9cfd5a","year":2019},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.732307Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:691777fc32f356789a7c824e8387013889ce32e1607cc026d683f175e8cbc9b3","observation_id":"c2dcbc2f-d836-467a-862a-4f9c72a737dd","resolution":{"observed_at":"2026-08-10T22:50:26.242711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.198865Z","title":"Mmlu-pro: A more ro- bust and challenging multi-task language under- standing benchmark,","venue":null,"work_id":"bd557f42-b117-44b0-ad42-db19e895df6d","year":2024},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.737991Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:207833d5f722d74cf12ea149f7bb514f6399bb523307addfec19b605ed36c95b","observation_id":"0967165d-5df9-44d6-96ba-657c9798e496","resolution":{"observed_at":"2026-08-10T22:50:26.211781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.173331Z","title":"Gpqa: A graduate-level google-proof q&a benchmark,","venue":null,"work_id":"d135569c-ec01-4f63-8465-fd445e5c2287","year":2023},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.743440Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:4bb0ae10b8279759771e1aeab02a6737f68fc49efdd8e965ea830d5f43cc4a3e","observation_id":"99d13ad5-ceb7-4bce-85ef-d22f90b7f08c","resolution":{"observed_at":"2026-08-10T22:50:26.178193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.154841Z","title":"Instruction- following evaluation for large language models,","venue":null,"work_id":"0563098b-9a31-43c9-b398-a3fd2da68628","year":2023},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.748566Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:ef4325a8228a492f16f773d6f4ceb7bc3f46b78d841ac077d9be97e63304812b","observation_id":"33fc12c3-00e1-4c7b-b7ad-d491992fd3b9","resolution":{"observed_at":"2026-08-10T22:50:26.160518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.138439Z","title":"Multilingual massive multitask language under- standing (mmmlu)","venue":null,"work_id":"d1e5dbb3-01c9-4c82-86e6-ff91a78c3864","year":2024},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.752785Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:eed99e98a719fbc427dfc7a5a8c4fb32a86d65c507e3351bd9fcee64ab34ceef","observation_id":"2ee9c884-b2e6-4fca-b519-c606146024c4","resolution":{"observed_at":"2026-08-10T22:50:26.144233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.124813Z","title":"Arabicmmlu: As- sessing massive multitask language understand- ing in arabic,","venue":null,"work_id":"3d0672e1-04ce-4efd-9678-611d58426737","year":2024},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.763735Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:4fb1f3d311d5683bf08bec8e12d30810b8c8260e6c93cd585315a3aa30a42f0c","observation_id":"65a3444b-fc16-423f-8363-f85fd0b53da9","resolution":{"observed_at":"2026-08-10T22:50:26.129803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.106191Z","title":"A deep neural network optimized by a genetic al- gorithm to improve arabic sentiment classifica- tion,","venue":null,"work_id":"450a9a43-b291-4db6-a654-82b2672081c5","year":2023},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.768548Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:0f2a652633055bb12c7aee8c47a671c474768cf4a77b79d0860dddd5e3402b64","observation_id":"1559eae9-5e70-4f95-8b64-ce0214183032","resolution":{"observed_at":"2026-08-10T22:50:26.113352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.086929Z","title":"Weighted entropy corti- cal algorithms for isolated arabic speech recogni- tion,","venue":null,"work_id":"75e050c1-7f95-40e5-8f2c-6c4ed1936b50","year":2013},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.775409Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:0921af6d4d6b03bbf73771bf42671e5995fb6792def955aca95b57eb922552d2","observation_id":"b2eea073-3cd3-4ce3-a0e4-868d6ffcad6a","resolution":{"observed_at":"2026-08-10T22:50:26.092491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.069158Z","title":"Non-diacritized arabic speech recog- nition based on cnn-lstm and attention-based models,","venue":null,"work_id":"fc209273-3c07-4316-825e-5df84dcb1ec5","year":2021},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.780443Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:8765cb8fa1a2cac57b3f66bc1c881c87c069a544a76c7cf7157b613b501eb31b","observation_id":"8f758b26-e894-4052-9d0e-51b2a14a9fba","resolution":{"observed_at":"2026-08-10T22:50:26.074893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.042533Z","title":"Qalam : A multimodal llm for arabic optical character and handwriting recognition,","venue":null,"work_id":"5a43cc2c-91a1-4256-ad50-4bcda202cb6e","year":2024},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.784802Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:4c1d3684ebbabf9bcbd34fcfc5972e902c4f351b5e5f2607884bf7241a58b68a","observation_id":"66fbe260-a5a0-4d33-bb2f-3fbe3cf36c84","resolution":{"observed_at":"2026-08-10T22:50:26.050761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.025064Z","title":"Towards a deep learning question-answering specialized chatbot for objective structured clin- ical examinations,","venue":null,"work_id":"e444c540-810b-4a44-8204-1950c31763fb","year":2019},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.789605Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:c5002ace1913987df3bd2dae7c5d6ba2dbf8fbdc1cd2faf1b503fc22ec4ba70a","observation_id":"9df2ab79-21ad-46fa-be96-342a6bb9f6c9","resolution":{"observed_at":"2026-08-10T22:50:26.031709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:26.003775Z","title":"Question dif- ficulty prediction for multiple choice problems in medical exams,","venue":null,"work_id":"2d31a373-dd0c-40dc-98f5-0ee49bff8465","year":2019},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.793902Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:7956730bae11d209d1b43b5859c45ff9dbff1dc7a221f8a238d56db6c42123b6","observation_id":"b88ee1b3-b643-43ea-b098-bd4569a4bbf1","resolution":{"observed_at":"2026-08-10T22:50:26.010151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:25.982433Z","title":"The data provenance initiative: A large scale audit of dataset licensing & attribution in ai","venue":null,"work_id":"3c1f3df7-faf7-4df2-8b57-69977bd978b2","year":null},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.797889Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:f4efd37682a094febd31ab0eefd470dce837bd9483976c89fe2761d2379266cc","observation_id":"02facbb7-9309-4129-8b9e-21abc0636d30","resolution":{"observed_at":"2026-08-10T22:50:25.989565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05672","last_updated":"2024-02-08T13:47:50Z","snapshot_observed_at":"2026-08-12T15:58:37.148545Z","submitted_at":"2024-02-08T13:47:50Z","title":"Multilingual E5 Text Embeddings: A Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05672","snapshot_observed_at":"2026-08-10T22:50:25.802278Z","title":"Multilingual e5 text em- beddings: A technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.802278Z"},"links":{"cited_paper":"/paper/2402.05672","citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:b69d863d6938df88180666af52f16f2bf84adb56660edcaa4f83f7200cc7b741","observation_id":"0cd14c0d-e33a-46cd-af10-50ea4cb1a807","resolution":{"observed_at":"2026-08-10T22:50:25.802278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:25.806971Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.806971Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:acfdd1ef439d8ac4a39ba76f8cc2d78a09f9a5a2783b2a0231b2159d670f377a","observation_id":"c9cc5540-5084-4d64-b510-b9430ae73578","resolution":{"observed_at":"2026-08-10T22:50:25.806971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:25.810599Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.810599Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:4db8d4cefd20c252f4bfbf7ca4eb6b1dfa647e7ceb005fb044615a3b703c4e70","observation_id":"a01ead31-dbd3-44f0-a1a2-b4b8a3921d49","resolution":{"observed_at":"2026-08-10T22:50:25.810599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:25.935853Z","title":"AceGPT, localizing large language models in Arabic,","venue":null,"work_id":"ec1cdaf0-5e4b-422f-a1ad-7ef546c1b7d1","year":2024},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.814847Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:3945292dc001200d66be4760533b798c9d41fca06356c488044855654f6bdb7d","observation_id":"3a36ca7a-f179-4abb-9c38-9028a4cb7a61","resolution":{"observed_at":"2026-08-10T22:50:25.941658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:25.920000Z","title":"The llama 3 herd of models,","venue":null,"work_id":"60053237-6796-4cbc-98b0-299683f34d53","year":2024},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.818608Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:161e5530515f4dba9fa968455ee9ffc45354da5c7bdcda9124a7ba9608ad6bbc","observation_id":"450d3577-6d69-4c0c-ac5b-5623c7825041","resolution":{"observed_at":"2026-08-10T22:50:25.924738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:25.898307Z","title":"Training compute-optimal large language models,","venue":null,"work_id":"177c44ba-b6d6-465e-8210-102e27349591","year":2022},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.822710Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:c7834a7d2eba4a7172e3bf4c6818fc86e2a080382956f1ca4f737d24f5579188","observation_id":"30543f7c-8846-4bd2-a516-af7f421575fc","resolution":{"observed_at":"2026-08-10T22:50:25.904875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:50:25.878987Z","title":"On the explain- ability of natural language processing deep mod- els,","venue":null,"work_id":"acf7d4a7-d99b-4067-b559-c1570c71518e","year":2022},"citing_paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:25.827128Z"},"links":{"citing_paper":"/paper/2501.00559"},"observation_digest":"sha256:eb97a22a9cd2e86e30129ceb762148dcdb54c8ab59b97dee0b63dd5fecbd21f3","observation_id":"f688259f-5bb3-4d9e-b146-0d1f81faa891","resolution":{"observed_at":"2026-08-10T22:50:25.885704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00559","last_updated":"2024-12-31T17:45:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T05:48:44.742824Z","submitted_at":"2024-12-31T17:45:12Z","title":"AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 4 inbound Pith citation observations for arXiv:2501.00559."}