{"as_of":"2026-08-18T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e64e0dfae869d3b9d08cdc036ad159d06042308a11dccac2bc8fb580aaa6aca","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:09:01.728564Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:39:36.819142Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T22:40:49.906159Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"cited_work":{"arxiv_id":"2502.01683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01683","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm-powered benchmark factory: Reliable, generic, and efficient","venue":null,"work_id":"24e9f644-3195-4fe6-a9b0-20169a079e01","year":2025},"citing_paper":{"arxiv_id":"2604.04386","last_updated":"2026-04-06T03:27:48Z","snapshot_observed_at":"2026-08-16T12:03:33.373865Z","submitted_at":"2026-04-06T03:27:48Z","title":"Automatically Generating Hard Math Problems from Hypothesis-Driven Error Analysis","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T19:39:36.819142Z"},"links":{"cited_paper":"/paper/2502.01683","citing_paper":"/paper/2604.04386"},"observation_digest":"sha256:3cc6ae287ec3eb5ab710baccfc994a91dc408e390219fdc7b5033a0b516fb9cf","observation_id":"c925eb55-b244-4ff4-a252-25304c795a85","resolution":{"observed_at":"2026-05-10T22:40:49.911691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01683/citation-record","integrity":"/paper/2502.01683/integrity","json":"/paper/2502.01683/citation-record.json","paper":"/paper/2502.01683"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.309254Z","title":"Claude 3.5","venue":null,"work_id":"8f80004e-5ea5-4ff0-b2cc-b6f315aa1c8d","year":null},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.591091Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:f51a0299c316e1ce07912ada6014d98e52e383495d6f9bbb03b943b274109526","observation_id":"9cfc5650-ba39-478e-84b4-ee36304aca78","resolution":{"observed_at":"2026-08-09T18:09:02.311909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.301916Z","title":null,"venue":null,"work_id":"a72aa253-c038-4cdb-a64e-8984e6326810","year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.594566Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:701bf412577988c862d88ecba72ef82a6b7058c102d4dce7fed3d93080505a0b","observation_id":"409b5d83-32f7-40d0-90ca-e91565196e3c","resolution":{"observed_at":"2026-08-09T18:09:02.304253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20094","last_updated":"2025-05-08T00:24:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-28T17:59:01Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20094","snapshot_observed_at":"2026-08-09T18:09:01.597866Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.597866Z"},"links":{"cited_paper":"/paper/2406.20094","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:f2bf4c242a9bac73a1e24d5d16f517774f0e50ce9b43ad1bff264d85c50e6250","observation_id":"36a20913-6729-453e-880c-f85fcff73202","resolution":{"observed_at":"2026-08-09T18:09:01.597866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.601806Z","title":"Yu, Qiang Yang, and Xing Xie","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.601806Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:3822c03176c0caf19d1d3e4fdcbc089242536ddcce7fc132001a2dedf86cad7f","observation_id":"92662432-f6f3-4d5e-954c-b51bd990f875","resolution":{"observed_at":"2026-08-09T18:09:01.601806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-13T13:45:44.430193Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-09T18:09:01.604922Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.604922Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:9e237054ee8d2bc86f796179e34cee0907a5262804d5ad5a8fa0e48bbd0a6320","observation_id":"63181b01-6028-476d-a761-cf84cc0c8618","resolution":{"observed_at":"2026-08-09T18:09:01.604922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.608303Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.608303Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:192aaf9599b2ae184092f845113a0d15c86d299e6eebaf3511b9175eba8d99c2","observation_id":"a34b53b7-cf57-4948-83e5-602a6b6665bf","resolution":{"observed_at":"2026-08-09T18:09:01.608303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.293715Z","title":null,"venue":null,"work_id":"36c80460-71d0-442b-8bf3-8180035152d4","year":1950},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.611435Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:3f154f2e94a68fae434ef6159309c5d800ed508b7b7766d54b39674d34697ce4","observation_id":"0c544555-8fb4-4a4d-862e-3b86ac823563","resolution":{"observed_at":"2026-08-09T18:09:02.296828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.614868Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.614868Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:cab111c1d78a142709c878f875e5778af67107eed53e6ae1dbf09e20207c4961","observation_id":"98f7e8f4-cd76-4e95-acbf-8ac9a4df1e8d","resolution":{"observed_at":"2026-08-09T18:09:01.614868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.278404Z","title":null,"venue":null,"work_id":"0114e109-4a80-4f95-8545-f154090399a9","year":2021},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.617635Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:0bd34baf5149daafb8f0208dc523bc5fced0a82fa136a3cf4bf4318e74c0b581","observation_id":"e87f3976-8e7a-4022-a988-58993e941b82","resolution":{"observed_at":"2026-08-09T18:09:02.282798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.269712Z","title":null,"venue":null,"work_id":"a6a38e02-0ed0-4391-8e8b-f10ddfe84967","year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.620591Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:e11e4a236917da3f00778c4a50952ad9f321d740d26d233406ce205a2fc06596","observation_id":"883b262a-7a1d-4d85-a5a3-b806e69c743c","resolution":{"observed_at":"2026-08-09T18:09:02.272809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-09T18:09:01.624555Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.624555Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:6b47b266a8894988ed0e9ecf0e55abc465c7944dce29da882e94fdea328b4a59","observation_id":"46110983-3b6c-4d9d-a724-85304659df95","resolution":{"observed_at":"2026-08-09T18:09:01.624555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.627606Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.627606Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:3fdef68f4c0c77b40db36479181c689ecd23d8ee0be32abf27b634197bf38719","observation_id":"8048585d-e5f7-4b1b-97c7-e9d50480054f","resolution":{"observed_at":"2026-08-09T18:09:01.627606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.15475","last_updated":"2026-05-26T21:14:13Z","snapshot_observed_at":"2026-08-16T16:49:09.174277Z","submitted_at":"2022-06-30T17:59:15Z","title":"Causal Machine Learning: A Survey and Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.15475","snapshot_observed_at":"2026-08-09T18:09:01.630239Z","title":"Kusner, and Ricardo Silva","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.630239Z"},"links":{"cited_paper":"/paper/2206.15475","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:0a51e2ddf36c559aa5af300a1fac33f1fac80cf04097400e64bbc055ed0fad07","observation_id":"b41e42e1-dd22-4450-b693-b7db6bbc2283","resolution":{"observed_at":"2026-08-09T18:09:01.630239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15147","last_updated":"2024-04-06T15:20:18Z","snapshot_observed_at":"2026-08-16T14:49:38.687100Z","submitted_at":"2023-10-23T17:52:06Z","title":"S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15147","snapshot_observed_at":"2026-08-09T18:09:01.632998Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.632998Z"},"links":{"cited_paper":"/paper/2310.15147","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:6fced65da0330dab89db7322bc54c9b3b98241c3f6b91344a3b6b229f23caf9a","observation_id":"ed49413c-ef14-4cc2-9cf8-c678d0e839e4","resolution":{"observed_at":"2026-08-09T18:09:01.632998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.636225Z","title":"u ttler, Mike Lewis, Wen - tau Yih, Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.636225Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:4fa6f1fa986ecc54309f7e71784b6192216cb85632e172bd7d96e5908f7a2d7b","observation_id":"9dc084b1-b4bb-49ff-a534-a4ec3c054b90","resolution":{"observed_at":"2026-08-09T18:09:01.636225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19740","last_updated":"2024-10-18T06:57:08Z","snapshot_observed_at":"2026-08-16T13:47:54.356093Z","submitted_at":"2024-05-30T06:38:32Z","title":"PertEval: Unveiling Real Knowledge Capacity of LLMs with Knowledge-Invariant Perturbations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19740","snapshot_observed_at":"2026-08-09T18:09:01.639375Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.639375Z"},"links":{"cited_paper":"/paper/2405.19740","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:dd8be8a1cc46b362fef96e3c058d66e6c240ee41e23fed319e2b7a95f9efd19c","observation_id":"a9011def-dae2-4f1d-87ff-a979333e27b6","resolution":{"observed_at":"2026-08-09T18:09:01.639375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15545","last_updated":"2025-04-18T07:56:16Z","snapshot_observed_at":"2026-08-17T23:34:15.833774Z","submitted_at":"2024-08-28T05:41:52Z","title":"SciLitLLM: How to Adapt LLMs for Scientific Literature Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15545","snapshot_observed_at":"2026-08-09T18:09:01.642749Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.642749Z"},"links":{"cited_paper":"/paper/2408.15545","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:65da16e5b4b0969fcf50e3a5a5c9e28118dc95a9d9f9a4f8b49b697592481f2d","observation_id":"9de263b1-2e74-46f2-9b23-f5dce2ebfe53","resolution":{"observed_at":"2026-08-09T18:09:01.642749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04857","last_updated":"2024-12-06T08:49:49Z","snapshot_observed_at":"2026-08-18T09:40:39.578706Z","submitted_at":"2024-12-06T08:49:49Z","title":"Neuro-Symbolic Data Generation for Math Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04857","snapshot_observed_at":"2026-08-09T18:09:01.645942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.645942Z"},"links":{"cited_paper":"/paper/2412.04857","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:45a5bbbd43aeec63d92fe898d6f39f7189f0263fd990fb6dd3dbd71771bd04b6","observation_id":"fa841f16-f458-4531-b321-e2c6e00cf99c","resolution":{"observed_at":"2026-08-09T18:09:01.645942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.256620Z","title":null,"venue":null,"work_id":"ae96b285-5d28-47c5-b7a2-f4ff33eb7a2a","year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.649187Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:2c3a2233f6a20ec663ad9dd8d85f267ba35727fa9b879ac332bc9c1dc530fe3a","observation_id":"f34460d2-0fbb-435c-9df8-cf06c89b198e","resolution":{"observed_at":"2026-08-09T18:09:02.259671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.651983Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.651983Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:4229ea2f1c66d032d316c1fb7b0a0f877aa2bde09d02b5959108b3e31c2d820e","observation_id":"6bae59c9-87d6-4204-992f-178418605f0d","resolution":{"observed_at":"2026-08-09T18:09:01.651983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10627","last_updated":"2024-07-15T11:26:07Z","snapshot_observed_at":"2026-08-17T21:56:31.436746Z","submitted_at":"2024-07-15T11:26:07Z","title":"Arena Learning: Build Data Flywheel for LLMs Post-training via Simulated Chatbot Arena","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10627","snapshot_observed_at":"2026-08-09T18:09:01.654904Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.654904Z"},"links":{"cited_paper":"/paper/2407.10627","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:1db77893e4713ef856511d70e62357f676337281afce523be5f2deb0aab9cc53","observation_id":"4b83488c-1a55-4c61-99f9-e55a04e3cea2","resolution":{"observed_at":"2026-08-09T18:09:01.654904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.247662Z","title":null,"venue":null,"work_id":"34ca2828-830e-4713-bee0-aafbf0ddb64c","year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.658012Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:c5f1c54a08a5cb9b120ff0d40d4df03ac7f6d758f9b11a3a5a60cb8141426bcf","observation_id":"062255dc-8e6f-4159-a0b9-9b7359880775","resolution":{"observed_at":"2026-08-09T18:09:02.250661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11968","last_updated":"2024-09-18T13:20:23Z","snapshot_observed_at":"2026-08-16T13:17:29.705424Z","submitted_at":"2024-09-18T13:20:23Z","title":"Efficacy of Synthetic Data as a Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11968","snapshot_observed_at":"2026-08-09T18:09:01.660763Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.660763Z"},"links":{"cited_paper":"/paper/2409.11968","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:67a5f4b4ad6555db476adfadcfae1847284220e44cc821895cc52ca61b9d7402","observation_id":"47e2f6de-f977-4a8f-a546-7593aeafc266","resolution":{"observed_at":"2026-08-09T18:09:01.660763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03971","last_updated":"2019-05-20T21:14:54Z","snapshot_observed_at":"2026-08-14T16:50:04.775967Z","submitted_at":"2019-04-08T11:44:41Z","title":"Jointly Measuring Diversity and Quality in Text Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03971","snapshot_observed_at":"2026-08-09T18:09:01.663911Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.663911Z"},"links":{"cited_paper":"/paper/1904.03971","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:4af63d50f1fa07798d23b6f4b06b9e016d3eda1870e47a4ed739ecf3f7aa28f6","observation_id":"813d0a62-8588-41a4-9753-68695f3865a2","resolution":{"observed_at":"2026-08-09T18:09:01.663911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.238466Z","title":"text-embedding-ada-002","venue":null,"work_id":"a82ca194-d540-4389-a971-48927854120b","year":null},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.667583Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:dbc50e016ebc65fba2247ac528af8944eb5f8b53a2b6d04bd89c80650ed2aac9","observation_id":"01342007-e778-4b7c-9999-a77c32f4bee6","resolution":{"observed_at":"2026-08-09T18:09:02.241496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.670630Z","title":"Bowman, Amanda Askell, Roger Grosse, Danny Hernandez, Deep Ganguli, Evan Hubinger, Nicholas Schiefer, and Jared Kaplan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.670630Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:e28d98dee8f44a87624c5ca8904d4daf54297b1756baead2e0b239a531357b86","observation_id":"1d3daef6-8ce7-4d38-920d-10f5a683dc7b","resolution":{"observed_at":"2026-08-09T18:09:01.670630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.225117Z","title":null,"venue":null,"work_id":"378a0937-6819-43fe-992a-18858b5d7aad","year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.673654Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:37bbdf00cf0a7a0583c9346073325babfaae9a385d7441aa4e088dc6864b4a71","observation_id":"c3ac89a6-e4f0-452f-9a4f-66abd3dcc4f5","resolution":{"observed_at":"2026-08-09T18:09:02.227588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14387","last_updated":"2024-06-03T17:47:30Z","snapshot_observed_at":"2026-08-18T08:11:04.376031Z","submitted_at":"2024-04-22T17:43:23Z","title":"A Survey on Self-Evolution of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14387","snapshot_observed_at":"2026-08-09T18:09:01.676414Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.676414Z"},"links":{"cited_paper":"/paper/2404.14387","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:ee412ff781d24021c15bb6a6aad092135a8c2cf7ebe63c859bb198b15b009228","observation_id":"322e1967-c2d6-4d9b-9e65-c7729d065468","resolution":{"observed_at":"2026-08-09T18:09:01.676414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-17T19:11:58.232946Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-08-09T18:09:01.679147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.679147Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:6ef0e95676ca30dbd0815bd2090cac8476031d4058e5aa1690667f8c7af004c3","observation_id":"6338cc35-3f69-4baf-81b6-61d9ce791fa7","resolution":{"observed_at":"2026-08-09T18:09:01.679147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.681746Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.681746Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:109d5d716b66ca885fcf041149e939e68e973f7e1cb43d06fd3d7a93a21cb75b","observation_id":"15100bd0-b637-4948-b51c-5437ba88c379","resolution":{"observed_at":"2026-08-09T18:09:01.681746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12896","last_updated":"2024-10-16T16:12:39Z","snapshot_observed_at":"2026-08-16T13:08:44.642036Z","submitted_at":"2024-10-16T16:12:39Z","title":"A Survey on Data Synthesis and Augmentation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12896","snapshot_observed_at":"2026-08-09T18:09:01.684146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.684146Z"},"links":{"cited_paper":"/paper/2410.12896","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:dcea44a3db29387225b7300f46a559aedecc461fa5798ff1f2dbf64ae8d9f440","observation_id":"7aadc72c-cbde-4595-9497-b379dc9755cc","resolution":{"observed_at":"2026-08-09T18:09:01.684146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.217147Z","title":"Le, Ed H","venue":null,"work_id":"6a3e5b86-da13-40e9-9234-f152c30bcc73","year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.686768Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:e617655b05883fb165d6f1afbaaaac57725019126b40ebfc9a6ac478f0a7da88","observation_id":"802f192e-afe5-4bc8-8a87-08459d2ff2e5","resolution":{"observed_at":"2026-08-09T18:09:02.219700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.689516Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.689516Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:7d5313f6527d0718f5a76e2c0d9e5800e98a784e4b299785f61365569bdaa94a","observation_id":"0dfa2173-c8c7-4ebc-843b-b17971b1f720","resolution":{"observed_at":"2026-08-09T18:09:01.689516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-17T13:17:07.963143Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-09T18:09:01.692472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.692472Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:da0d9f5a7f2007b51a095b144c1c04e269fe7defef7111d1f0cffa316aba7039","observation_id":"f201a6fa-2ab2-48c6-9b03-78a3b22f9612","resolution":{"observed_at":"2026-08-09T18:09:01.692472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.695833Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.695833Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:a6c011caeffda95c4af886b1d41b9e2852ca5e4a30ba3374b3f357996e03fb05","observation_id":"a00b135b-b20e-4822-b2c6-cbe659517f71","resolution":{"observed_at":"2026-08-09T18:09:01.695833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-09T18:09:01.699197Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.699197Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:acb8090f23b7a49919d1063c2ff17df4577ac759b00a7a96c22a6e9767f3d7ca","observation_id":"349d573e-8f42-4ca0-8451-ab19848bfad3","resolution":{"observed_at":"2026-08-09T18:09:01.699197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.702260Z","title":"Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.702260Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:ee1f16e6a428af80da9144b0364e52522842506c1311f8ea57a2c05c75d2f1ca","observation_id":"23275359-7005-4eb7-865c-0dfc726f1abf","resolution":{"observed_at":"2026-08-09T18:09:01.702260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.202573Z","title":"Ratner, Ranjay Krishna, Jiaming Shen, and Chao Zhang","venue":null,"work_id":"596bf10d-ec49-48d0-b1f1-f5b49769a236","year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.705080Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:d0de5a17ef2a38a6651f70282887e2cc1269e1618ab0a1b4e624acf9170b101f","observation_id":"6d891ced-ae80-4651-8f13-d79f342473d2","resolution":{"observed_at":"2026-08-09T18:09:02.206843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.708002Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.708002Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:5ba339968ac7817236605a0c3eed63714ed09492b035ed470eb56560f2f493bd","observation_id":"01b89090-28f8-44de-9f76-cf7415f5dd79","resolution":{"observed_at":"2026-08-09T18:09:01.708002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.711080Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.711080Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:cb597086498e8fbdf82edd36783e846fccd22827e59d57bf4bc5174d2c0ac1cc","observation_id":"1a30f425-3980-4673-b508-1551318daebf","resolution":{"observed_at":"2026-08-09T18:09:01.711080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.188530Z","title":null,"venue":null,"work_id":"28141b87-0e94-4d58-8981-0ad4b33e583c","year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.714267Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:96557d0eeb9cbdef1b5d46475712cbaebb367dd105fa1617f72a4e2a3f83e053","observation_id":"327f84c9-0dcd-4483-98f7-2268689f33f9","resolution":{"observed_at":"2026-08-09T18:09:02.191757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14865","last_updated":"2024-06-07T09:19:45Z","snapshot_observed_at":"2026-08-16T14:16:42.785847Z","submitted_at":"2024-02-21T06:46:34Z","title":"Dynamic Evaluation of Large Language Models by Meta Probing Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14865","snapshot_observed_at":"2026-08-09T18:09:01.717256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.717256Z"},"links":{"cited_paper":"/paper/2402.14865","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:dead46acd219d51d4beb9748ff7175ff0e25b2d53a6f4ec0f59f97083f601eb0","observation_id":"1ee7a73b-7456-4d9b-8939-e8246680a985","resolution":{"observed_at":"2026-08-09T18:09:01.717256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.153799Z","title":null,"venue":null,"work_id":"57a69fe5-bccc-405d-b50d-a1ec80cd272f","year":2018},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.720740Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:0aa659ce286b932a74e06796056cada7ffa3eccf713b3d36a0c938d1424c1c6f","observation_id":"a16acfb5-74d5-4b93-9f88-ea0107d16fcb","resolution":{"observed_at":"2026-08-09T18:09:02.157754Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.724723Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.724723Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:1d1e08cbe50a474726cbd6400114b05fa0df27bba5b644be6cf5e76a0f8188d3","observation_id":"8b6d801a-7488-4531-aaa1-6d43c4e56507","resolution":{"observed_at":"2026-08-09T18:09:01.724723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.728564Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.728564Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:db507265d075a7a62d9d18fae7b9bdde4b72d95ea1b9bad00b3ca23bca023e51","observation_id":"26448a66-4b4f-4581-b83b-0d457d9303ed","resolution":{"observed_at":"2026-08-09T18:09:01.728564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T18:51:10.225657Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2502.01683."}