{"as_of":"2026-08-10T04:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b34745d4855c863b338fb12d54f07b7d31f8dc6ed7fe74b846d018aad673a57b","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:02:35.839991Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:45:42.748430Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T14:45:42.844290Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"cited_work":{"arxiv_id":"2502.03358","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.03358","snapshot_observed_at":"2026-08-06T14:45:42.844290Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","venue":"cs.CL","work_id":"3f8ea708-e16b-48f0-9731-2e1b0891df17","year":2025},"citing_paper":{"arxiv_id":"2507.18182","last_updated":"2025-08-04T15:53:52Z","snapshot_observed_at":"2026-08-09T07:56:18.111390Z","submitted_at":"2025-07-24T08:28:17Z","title":"SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:42.748430Z"},"links":{"cited_paper":"/paper/2502.03358","citing_paper":"/paper/2507.18182"},"observation_digest":"sha256:00a86c7436431f29a6e5129e009502fc2eec9f0525bdcb97a9b20cb0ead48a42","observation_id":"91e16ef8-01f0-4903-8d7c-ca63f47db4b5","resolution":{"observed_at":"2026-08-06T14:45:42.847863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.03358/citation-record","integrity":"/paper/2502.03358/integrity","json":"/paper/2502.03358/citation-record.json","paper":"/paper/2502.03358"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.661718Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.661718Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:92b290df4e8e1332a649c321a7707de0c6eceb3f83e8a344ee89ef9461994a1d","observation_id":"29a4f6e6-c178-48e6-b19b-24dfe3bd3fc8","resolution":{"observed_at":"2026-08-09T05:02:35.661718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.667851Z","title":"L -eval: Instituting standardized evaluation for long context language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.667851Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:a0cc0c3f967d994f3734b8644ec2a22012634d0f5299c63928389b6db1a9f5dc","observation_id":"763a9878-9177-475e-82e9-ad4738716eb4","resolution":{"observed_at":"2026-08-09T05:02:35.667851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:36.557238Z","title":"Introducing the next generation of claude","venue":null,"work_id":"ea26619e-9e99-45dd-b513-92f6760edcf9","year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.674479Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:ed26c42647aca147ac691f8046f280901c7e890ba814ebf92adf3900fb342e29","observation_id":"6acbe83c-b5c8-4b93-896d-a336bb61334e","resolution":{"observed_at":"2026-08-09T05:02:36.562838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.680215Z","title":"L ong B ench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.680215Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:67c679c13b6080258164e4eace49ba8d72eb0b6459609a66d19b3380f2a519d8","observation_id":"08565b99-00ed-4a4c-b455-f9a95c7fec0a","resolution":{"observed_at":"2026-08-09T05:02:35.680215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-09T05:02:35.685716Z","title":"Titans: Learning to memorize at test time, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.685716Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:cbd871355ec3cd42410bdd7791c5279da72a29225f7878fc0794b8854449baea","observation_id":"6310a15e-cfde-4e15-96c3-32b56d2e753f","resolution":{"observed_at":"2026-08-09T05:02:35.685716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.692412Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.692412Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:da7163aceef40e6fe16a3747a052ab6b5d3934e07ba961126980c5a19d5f5468","observation_id":"937847f7-f07c-4cd1-b8cc-c8af2ce6897b","resolution":{"observed_at":"2026-08-09T05:02:35.692412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-09T05:02:35.697882Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.697882Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:e1a680e254d442368a3bbe09dd708191c70168dac10aa6864d96535709de6349","observation_id":"90abd7c7-3bdd-4023-9011-ef3566e3a131","resolution":{"observed_at":"2026-08-09T05:02:35.697882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-09T05:02:35.703972Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.703972Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:6afeec412fdb6be5da0f97b389f6af60113715cc99129cc0a22fbfd26fd15ca7","observation_id":"e70f072c-0d17-47f7-ba8a-fd23d8a31ca8","resolution":{"observed_at":"2026-08-09T05:02:35.703972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:36.527745Z","title":"and Parrish, J","venue":null,"work_id":"c1ae65d9-ec2d-4123-98f4-12d323af2b81","year":1957},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.709350Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:7d84ccb03acd2f50dda5da04de394fbf846d7061cb3e8644c332764e8bd857ad","observation_id":"ed6aa7b0-c19f-4618-a00b-8fa8bf02a145","resolution":{"observed_at":"2026-08-09T05:02:36.533451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:36.504384Z","title":"L., Zhang, C., Xu, Y., Shang, N., Xu, J., Yang, F., and Yang, M","venue":null,"work_id":"6d023d35-023e-4813-a1e6-363b937cb7fe","year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.715006Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:319f33de671357f331785180aa521f651695f01631c72a977bd509fd550ed76e","observation_id":"a22c946c-ec87-45d2-a08c-4164611990a3","resolution":{"observed_at":"2026-08-09T05:02:36.510293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.720104Z","title":"Samsum corpus: A human-annotated dialogue dataset for abstractive summarization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.720104Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:8d9cf8a71e15d1513271b41bf38cbc6b4f3406cc62c0a5bdc80f6cb0a9ced660","observation_id":"0750460e-70b0-4218-9397-f65bcee6e05b","resolution":{"observed_at":"2026-08-09T05:02:35.720104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.725514Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.725514Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:fef149bdb682bc33dfbd4d6a8e92eb1acf2e0197ac41292cacfa39e02db37fe9","observation_id":"7224ee54-4e77-45f5-9ef3-1dc6cabf080e","resolution":{"observed_at":"2026-08-09T05:02:35.725514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:36.473271Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"18689a81-a70d-41a4-8131-2260f8e873c6","year":2021},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.730308Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:f2d3af30a43e024736b68b3af720ffc913ebd4f4846189920e0cd0bfabdabf7f","observation_id":"eed9a781-5a8d-4a1f-9841-82711df62484","resolution":{"observed_at":"2026-08-09T05:02:36.478963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.735311Z","title":"RULER : What s the real context size of your long-context language models? In First Conference on Language Modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.735311Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:37eaeb56bd337304912b98c1ab30d1c3b0a0486695796c35cb8543f6c0c71623","observation_id":"fda45a11-ae4b-4651-a8b3-ad2602087d08","resolution":{"observed_at":"2026-08-09T05:02:35.735311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:36.440212Z","title":"\\'E tude comparative de la distribution florale dans une portion des alpes et des jura","venue":null,"work_id":"ad09e92f-8d8b-4329-99b9-b62d81f37935","year":1901},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.740545Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:2312dcb5d16c3a3ecd44a66301ca37b504ea091e696a3778c6b4e59cac92f443","observation_id":"d3cd2227-cbaf-4606-ba62-292a8c05db52","resolution":{"observed_at":"2026-08-09T05:02:36.448313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:36.421183Z","title":"Needle in a haystack - pressure testing llms","venue":null,"work_id":"63e4067c-99a8-4c1d-b738-83d90eec6607","year":2023},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.745844Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:f19ea75bd9066f9a22e2962d82388e99eccd8fbf1dd5c7e147cd7a87772d640b","observation_id":"b62547bc-e52d-47e2-99ff-837bf8f17546","resolution":{"observed_at":"2026-08-09T05:02:36.427582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:36.402308Z","title":"L., Roebuck-Spencer, T., Short, P., Kabat, M., and Wilken, J","venue":null,"work_id":"94b13693-b290-4712-94e9-af09d21e4958","year":2007},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.750629Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:558c04aef62fd4c818b5e238988c357011bb242773a2e8d1c07fcd686fe7e9d7","observation_id":"92b11aeb-d4b1-456a-bd01-8b0ef69f66d3","resolution":{"observed_at":"2026-08-09T05:02:36.408571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.755897Z","title":"Natural questions: a benchmark for question answering research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.755897Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:f0342ca98f79da186800bd8ef34af1582ac97b3390cdd73da35b0715ee78a815","observation_id":"58bd7cd9-a8d3-43e2-8c16-a4a8a8c9ecdf","resolution":{"observed_at":"2026-08-09T05:02:35.755897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.760913Z","title":"Needlebench: Can llms do retrieval and reasoning in 1 million context window?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.760913Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:1c41a576246408ba18a82083d9a1ebf5604d036b82457b9e4b40d1a41024cfd6","observation_id":"3b95b20b-a29c-406f-ba3b-a6af96dcd958","resolution":{"observed_at":"2026-08-09T05:02:35.760913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.766110Z","title":"ROUGE : A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.766110Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:d3a53bf3de50b6bfe9f6ac7ffd98dacdc1030ca0431a48b96a602886e75906aa","observation_id":"c66f5e6f-780c-4726-aa8a-31d26277e4c8","resolution":{"observed_at":"2026-08-09T05:02:35.766110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.771083Z","title":"F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., and Liang, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.771083Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:5ca75f74a0de440f827dc5b69219dba16839e034af954a3dea7b4d59f934c09b","observation_id":"dda23753-5f5d-4645-b940-0c2720df951f","resolution":{"observed_at":"2026-08-09T05:02:35.771083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:36.363915Z","title":"P., Santorini, B., and Marcinkiewicz, M","venue":null,"work_id":"efda5d40-b9aa-4e99-864c-b1da3d48283e","year":1993},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.776578Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:9346d757cb9a3500f41d4355ceedcf9976a8ed92a2f409fca4dfa86fc3e5ae1c","observation_id":"075ecba1-1990-45a6-95de-eda68cce2c49","resolution":{"observed_at":"2026-08-09T05:02:36.368502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.781705Z","title":"and Jaggi, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.781705Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:9be462562b8f300c139218fd3a7cafb149fc04f1fac160b2770de1b1648c3f3d","observation_id":"a90cca0d-d06d-45cf-920c-a8fa6bbfb01d","resolution":{"observed_at":"2026-08-09T05:02:35.781705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:36.335325Z","title":"S., Phillips, N","venue":null,"work_id":"47cd6914-1f64-4bd2-8abc-0dcb3e0b7715","year":2005},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.786894Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:0f3d39073f7f8ea8562963a54ec9e853a9077a0809b48b09c5b4c4a2016441a9","observation_id":"13cf777e-9cc4-456f-901c-e6f1749dcc6a","resolution":{"observed_at":"2026-08-09T05:02:36.340785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11802","last_updated":"2024-12-24T01:41:28Z","snapshot_observed_at":"2026-08-10T01:47:41.207025Z","submitted_at":"2024-03-18T14:01:45Z","title":"Counting-Stars: A Multi-evidence, Position-aware, and Scalable Benchmark for Evaluating Long-Context Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11802","snapshot_observed_at":"2026-08-09T05:02:35.791965Z","title":"Counting-stars: A multi-evidence, position-aware, and scalable benchmark for evaluating long-context large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.791965Z"},"links":{"cited_paper":"/paper/2403.11802","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:4b79d3a7925ec386fc9754fa7cde9c85d128bf15143a50f6b0058446a51d55b7","observation_id":"d77c31fd-0d56-48ac-8840-c9e267636b88","resolution":{"observed_at":"2026-08-09T05:02:35.791965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-09T05:02:35.797402Z","title":"W., Chowdhery, A., Le, Q","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.797402Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:981e13d3c5dfaa7382187330081d992029660d8b7354994b2c16c48b3a5d8c7e","observation_id":"5c3ee4f6-2317-4594-92e0-52fca4eafe53","resolution":{"observed_at":"2026-08-09T05:02:35.797402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:36.315766Z","title":"N., Cowan, N., Hitch, G","venue":null,"work_id":"3cf9951d-8b6e-4fea-87d6-38fe5e142a70","year":2008},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.803868Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:73d02cb8e0f3ab082cd82a07d3cbb246b320ea6161f1838e91a71b7f59394572","observation_id":"dc5541e6-dfac-484e-bd56-d2c606e70a94","resolution":{"observed_at":"2026-08-09T05:02:36.322784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-07T08:29:46.650400Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-09T05:02:35.809700Z","title":"Voyager: An open-ended embodied agent with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.809700Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:0856dc2e5c77a1d9dd92a418ec2d994d5adbb794142c5f1064f3f0b9bbc5250a","observation_id":"94587577-eda0-49d7-a245-d4e5a3b5998a","resolution":{"observed_at":"2026-08-09T05:02:35.809700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-09T05:02:35.814615Z","title":"H., White, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.814615Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:4911f7029d7fd2c6c72814c3c802d866467a7d4239a5be831115c830b60ed07c","observation_id":"3b73982e-464e-4b68-bf70-1544973db5c3","resolution":{"observed_at":"2026-08-09T05:02:35.814615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02076","last_updated":"2025-01-23T00:52:08Z","snapshot_observed_at":"2026-08-09T15:51:57.712199Z","submitted_at":"2024-09-03T17:25:54Z","title":"LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02076","snapshot_observed_at":"2026-08-09T05:02:35.819407Z","title":"S., Hu, Z., and Lee, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.819407Z"},"links":{"cited_paper":"/paper/2409.02076","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:638de1560a60c19f96211ddde9b7250a9d5f17efc69c084d3d3e3b7c89b1824c","observation_id":"fdb49798-00d0-4640-aa9b-56a036f11a63","resolution":{"observed_at":"2026-08-09T05:02:35.819407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-07-06T16:24:38.375055Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-09T05:02:35.824173Z","title":"A., Oguz, B., Khabsa, M., Fang, H., Mehdad, Y., Narang, S., Malik, K., Fan, A., Bhosale, S., Edunov, S., Lewis, M., Wang, S., and Ma, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.824173Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:4a4de6c45fd83fc1f417426cd8a786dc7ba5ce8b8a556515800ed98cb76c6c06","observation_id":"39c83ac0-c8f2-4c4c-b025-86d7bc3dfe3d","resolution":{"observed_at":"2026-08-09T05:02:35.824173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.829428Z","title":"Inftybench: Extending long context evaluation beyond 100 K tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.829428Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:e3a3e474f9e70380eb5f59acecc7e83cf5db5cffca1dab031f7c309738094f16","observation_id":"e259a5de-34a1-4afc-a0b0-281e0397fc96","resolution":{"observed_at":"2026-08-09T05:02:35.829428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:02:35.834640Z","title":"E., and Stoica, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.834640Z"},"links":{"citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:5b2bfbb3abe66cd5f9cc28ae936f19ccd2f53b07354b29121d3cd5c86ad9c3d1","observation_id":"747ff55f-2722-43ff-9a37-ce7e8d5c38f2","resolution":{"observed_at":"2026-08-09T05:02:35.834640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-09T05:02:35.839991Z","title":"Agieval: A human-centric benchmark for evaluating foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.839991Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:34390cee0d92e12922c9444a857e43ae0e3214e7e976711be5cc2abf94023687","observation_id":"04cf8462-dd02-4483-b395-4a7ed7672cdc","resolution":{"observed_at":"2026-08-09T05:02:35.839991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T13:31:46.100534Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2502.03358."}