{"as_of":"2026-08-20T00:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9acb5d45325f6de53381398117574bf42e424e5e699bea6fa3fbb976898496cf","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:41:34.878542Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:59:49.787962Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19276","snapshot_observed_at":"2026-08-01T01:59:49.787962Z","title":"Memory decoder: A pretrained, plug-and-play memory for large language models.Advances in Neural Information Processing Systems, 38:115487–115510, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25614","last_updated":"2026-07-28T11:45:34Z","snapshot_observed_at":"2026-08-19T06:31:44.298606Z","submitted_at":"2026-07-28T11:45:34Z","title":"MemSFT: Mitigating Alignment Tax with an External Parametric Memory","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T01:59:49.787962Z"},"links":{"cited_paper":"/paper/2605.19276","citing_paper":"/paper/2607.25614"},"observation_digest":"sha256:565c2392b1f2ff87b8cd662ffcce8e424164d8a9ad06550b5d5ff02eaba5ad10","observation_id":"d9c2fd53-3dc8-4f36-93bc-8a52f7067c9a","resolution":{"observed_at":"2026-08-01T01:59:49.787962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19276/citation-record","integrity":"/paper/2605.19276/integrity","json":"/paper/2605.19276/citation-record.json","paper":"/paper/2605.19276"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.841449Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"ffe51955-969e-4a51-bd04-3fca1c9ae208","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:81f1786c4f1296f132d45ea06bbaca7464ef7da5d3cc4b51c843a49a1ee4593a","observation_id":"d592d2f6-3689-4cd5-a00e-b686cf03132e","resolution":{"observed_at":"2026-07-08T03:34:32.842784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04604","last_updated":"2025-01-08T05:24:50Z","snapshot_observed_at":"2026-08-16T13:00:34.704005Z","submitted_at":"2024-12-05T20:40:28Z","title":"ARC Prize 2024: Technical Report","version":2},"cited_work":{"arxiv_id":"2412.04604","doi":"10.48550/arxiv.2412.04604","metadata_source":"pith","pith_arxiv_id":"2412.04604","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Arc prize 2024: Technical report","venue":"cs.AI","work_id":"49bd7afe-e99e-4c34-8417-36562ab6cd8d","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2412.04604","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:844c17fb2c566dac2247b2004733362727e4ce8712f9d76d7d089624b62843b4","observation_id":"71843c89-91ee-46e1-b745-5a7c8035d78a","resolution":{"observed_at":"2026-06-30T18:45:00.502117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:16.324751+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:16.324751+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.839549Z","title":"Lmdeploy: A toolkit for compressing, deploying, and serving llm.https: //github.com/InternLM/lmdeploy","venue":null,"work_id":"1f1ab9d3-d1c8-4c88-b0a8-5ba827329652","year":2023},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:c34d4142fddad60206dbcd0c9272fd93dcd5caa1de35ff593b1110448812183e","observation_id":"75a1b657-6649-4020-9ce1-65c629aeccc8","resolution":{"observed_at":"2026-07-08T03:34:32.840887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.829981Z","title":"MMEngine: Openmmlab foundational library for training deep learning models","venue":null,"work_id":"e10fb3d2-075b-4259-be62-ca6728cbb15b","year":null},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:5f1b495502d2d9f0f292f24470d18a0edc9c80ebbd2bd3a99c89f789a5f5a156","observation_id":"0a0d9803-7ce2-4924-b3d8-ac51f9fb4e28","resolution":{"observed_at":"2026-07-08T03:34:32.831285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.837598Z","title":"Physics: Benchmarking foundation models on university-level physics problem solving","venue":null,"work_id":"ca6011fb-17f3-4b6a-9863-2def947c1d20","year":2023},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:82cf89c33de113a7252d09ea9c6a96a8a090233b40e35b0413bc35bb864356e8","observation_id":"ae30e3c5-e26f-4805-b60b-d8e64ac5360a","resolution":{"observed_at":"2026-07-08T03:34:32.838966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:852b39f1b1b3e156030c4b8e64ba9937271d738c97658b91dcd07fd76f38ce2d","observation_id":"f71df103-5455-45a5-b596-6a14c78bacfb","resolution":{"observed_at":"2026-06-30T18:45:00.508507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.821290Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"3914e57f-a5d7-4eb5-9236-0b0b42712964","year":2021},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:a41a97a8a0d68a60ee1c87e7027c3defcecf5d532a54fe43aa60809ad8df2193","observation_id":"70f6b27c-8ebd-45ff-9323-15ff9bc55762","resolution":{"observed_at":"2026-07-08T03:34:32.822755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-18T14:33:16.365411Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:ee8f15bcc81e8013b6968b48c22d16be291ff2e6c05dd46cc352b7d7fd45e7f2","observation_id":"fd4e5296-2d2d-4cfc-a779-b68347ca344a","resolution":{"observed_at":"2026-06-30T18:45:00.505348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:c9324ba7457e579e0f785b6cb49ebfee8f98e0bfc8c5d975ebf5df2ededb0cad","observation_id":"84eeaa5b-4d63-4434-92fd-42e42ae12c6d","resolution":{"observed_at":"2026-06-30T18:45:00.513123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.835799Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"25e7006d-b8df-4acf-a556-7e488f5bc2bb","year":null},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:9831422bcd77a451fff0b7c066643bc0f9726bcf2433efc5fcc278bb2cf8ff14","observation_id":"d4a2c6f4-899c-40a1-9da6-64e7ebe254a9","resolution":{"observed_at":"2026-07-08T03:34:32.837020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16701","last_updated":"2025-03-09T18:31:12Z","snapshot_observed_at":"2026-08-18T14:53:53.665380Z","submitted_at":"2024-10-22T05:12:19Z","title":"ClimaQA: An Automated Evaluation Framework for Climate Question Answering Models","version":2},"cited_work":{"arxiv_id":"2410.16701","doi":"10.48550/arxiv.2410.16701","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16701","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Climaqa: An automated evaluation framework for climate question answering models","venue":"arXiv (Cornell University)","work_id":"91de4d08-55e2-419c-ab18-1922e483d2e1","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2410.16701","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:84145fc3c6305b780cf6878427cab974d1489b3954e9dd02c6c2ee7de5d5094c","observation_id":"8fa6604c-aee4-4044-a3d5-dc3a1c4a6f20","resolution":{"observed_at":"2026-06-30T18:45:00.510578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":"2501.14249","doi":"10.1038/s41586-025-09962-4","metadata_source":"pith","pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Humanity's Last Exam","venue":"cs.LG","work_id":"59ea00d4-16a8-45e1-aafc-290a6f91d9f4","year":2025},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:5c8a440aaeef8b22d7e1402fe38801b0de78c8ec4d41db73d839f12a927f9653","observation_id":"9b8e936d-3c4c-4ce4-bb92-ef402ad1dd3c","resolution":{"observed_at":"2026-06-30T18:45:00.519875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-08-14T11:40:59.457005Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":"2507.02833","doi":"10.48550/arxiv.2507.02833","metadata_source":"pith","pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalizing Verifiable Instruction Following","venue":"cs.CL","work_id":"f761e9b8-8bc1-4bf7-bdab-175a13950f4e","year":2025},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:4ab361d37d180cfce55f47fe5334dc003a1a2ff4905b78db6ea9ff5f04fa9489","observation_id":"04cfaca0-f851-48e4-a4ea-333a348a2415","resolution":{"observed_at":"2026-06-30T18:45:00.522603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.843360Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":"daf8d71a-01ba-49c9-9ab3-1cdb046da3aa","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:d95dce05ad0450ffc262af4f29f2fd4d7e0daafab59ce1571c9e9966d79ead42","observation_id":"c8e155bb-869b-40e6-a463-0ed768a3a19c","resolution":{"observed_at":"2026-07-08T03:34:32.844694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.833773Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":"991c21e5-d530-4768-9bc0-7893018f3aea","year":2023},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:18a8ba35b3faa72835b16a0e7704a164b6bf412be0921abbb7840374901f9f45","observation_id":"00e1dd4e-1e7b-4a83-a767-4a376a74bd9e","resolution":{"observed_at":"2026-07-08T03:34:32.835142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:97b4e341917fd7d924484ad8b9c55cedcbf8445d5bcbb3ada82c9531df514b84","observation_id":"f8ec25ec-0c30-4789-b8ab-79d0c0058f19","resolution":{"observed_at":"2026-06-30T18:45:00.504164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.825862Z","title":"Openicl: An open-source framework for in-context learning","venue":null,"work_id":"1b04ecb7-9bef-48d9-893b-9d24ac1614e1","year":2023},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:cab189a13f50041992db89ce44df6f24f63b1688066a2ced816437034577eff4","observation_id":"69ed31f7-26d3-426e-a763-6ef3bf3c226b","resolution":{"observed_at":"2026-07-08T03:34:32.827268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09391","last_updated":"2024-08-10T13:28:11Z","snapshot_observed_at":"2026-08-16T14:18:32.527315Z","submitted_at":"2024-02-14T18:42:25Z","title":"LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset","version":4},"cited_work":{"arxiv_id":"2402.09391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09391","snapshot_observed_at":"2026-07-03T13:48:20.828423Z","title":"N.; Chen, Z.; Ning, X.; Sun, H","venue":null,"work_id":"a673bb59-ff38-4b43-a4f3-13bc7b33a5ca","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2402.09391","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:87c50881a4f9790c75e21fd64e985068c64ddb82241afbe31a01bb515aa524da","observation_id":"79721af4-5f87-4c63-b9df-a67a3c703a6a","resolution":{"observed_at":"2026-06-30T18:45:00.507659Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.823430Z","title":"Hellaswag: Can a machine really finish your sentence? InProceedings of the 61st Annual Meeting of the Association for Computational Linguistics (ACL)","venue":null,"work_id":"e0765442-b617-4156-9571-6e3dcca57063","year":2019},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:f26fc61c28dfabe91c932c78d5bdffbb7edc97b632a3e92712dd0c3a2255ed90","observation_id":"4342b2be-848a-402f-a365-b2b45a0d70d9","resolution":{"observed_at":"2026-07-08T03:34:32.824937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.827912Z","title":"P-mmeval: A parallel multilingual multitask benchmark for consistent evaluation of llms","venue":null,"work_id":"381ab676-0212-4b38-bec8-42d214fd67cf","year":2025},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:735c4151b857f426c917a484ac12138bb464dbb7d039a4d8d0f0861c2e4dcdef","observation_id":"a0f67ffe-b832-4361-b884-a0bb14748663","resolution":{"observed_at":"2026-07-08T03:34:32.829275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:cacf2dbcb4ac7ca89db8146fc6ebed3f4514f03258d81641e9a29c260d37cfda","observation_id":"0652a02d-29a8-4341-afe0-b8e1c143abd8","resolution":{"observed_at":"2026-06-30T18:45:00.527674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-08-14T15:45:30.011625Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":"2406.15877","doi":"10.48550/arxiv.2406.15877","metadata_source":"pith","pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","venue":"cs.SE","work_id":"14715c3c-002c-4bc4-8882-f7c586954d62","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:3d5cc1be0c4e0e08d9d00a1facbd93e0771fa1d8744a308097fdf4ff17668c43","observation_id":"b523fd04-a9c8-4360-9e61-e2e1b58b08f1","resolution":{"observed_at":"2026-06-30T18:45:00.525070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.831907Z","title":null,"venue":null,"work_id":"16536eb6-0444-49fd-b5b7-048a8b959a95","year":2025},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:c8e7324730a16d6cdaa74070d0e7e309605ca5070b5a6103c9015290f991bc24","observation_id":"49ce5992-0ec6-407e-a9eb-ef2370e8097e","resolution":{"observed_at":"2026-07-08T03:34:32.833117Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T21:07:41.252836Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":10,"verified_fuzzy":11},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2605.19276."}