{"as_of":"2026-08-13T22:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e34e8fd5bd8d0bca3c3cc54fad6eaf6b5abf5e88e0811bc1f6f66a7a85a45e3e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":37,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:18:33.053114Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:17:25.584510Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"reference_index":247,"source":"arxiv_source","source_observed_at":"2026-05-10T17:34:42.565806Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2403.07974"},"observation_digest":"sha256:2d2e80a0e3168d54ba43ad6fae4dffe6d661b53370b4b235be35c44b2b67c1e0","observation_id":"46277a58-65a3-4e94-8ce4-a6bd3367bbda","resolution":{"observed_at":"2026-05-10T17:34:42.875327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T20:18:06.304134Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2406.00515"},"observation_digest":"sha256:c352056d9470b062f70a4eff41502bbdf52377ec46d8ece13a2ad295ca6f2690","observation_id":"1d62edd9-b64b-40c5-a008-bca400849495","resolution":{"observed_at":"2026-05-13T20:18:06.772744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T12:33:38.867604Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2409.12186"},"observation_digest":"sha256:bc29a49666580d0433b457db4ab4b4605bb13674af253cec21a9b0bd150513e8","observation_id":"af0a18d4-c815-421d-8eb1-a7d96af12ea7","resolution":{"observed_at":"2026-05-10T12:33:38.933028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-12T14:18:33.053114Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15470","last_updated":"2024-11-23T06:40:47Z","snapshot_observed_at":"2026-08-13T03:25:22.865706Z","submitted_at":"2024-11-23T06:40:47Z","title":"A Preliminary Study of Multilingual Code Language Models for Code Generation Task Using Translated Benchmarks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:18:33.053114Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2411.15470"},"observation_digest":"sha256:295b7df24b19e4caaea0b16d7d43a092f0c3b2e05c44908ea38073640c178ea1","observation_id":"f254911f-c9bc-4589-b7c6-b262e42e460f","resolution":{"observed_at":"2026-08-12T14:18:33.053114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-12T05:20:05.316083Z","title":"Cassano, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00535","last_updated":"2025-05-12T10:24:14Z","snapshot_observed_at":"2026-08-12T06:21:06.712416Z","submitted_at":"2024-11-30T16:58:42Z","title":"FullStack Bench: Evaluating LLMs as Full Stack Coders","version":6},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T05:20:05.316083Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2412.00535"},"observation_digest":"sha256:8fab69846e9ddd1ca41a937fb75005e018c267b6c5ae629d3edbcb63cb331071","observation_id":"ab0d37de-0ee3-4c0c-8500-07ad65129277","resolution":{"observed_at":"2026-08-12T05:20:05.316083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-11T18:16:26.681696Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08109","last_updated":"2025-01-15T11:57:34Z","snapshot_observed_at":"2026-08-12T11:41:28.371308Z","submitted_at":"2024-12-11T05:31:39Z","title":"Unseen Horizons: Unveiling the Real Capability of LLM Code Generation Beyond the Familiar","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.681696Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2412.08109"},"observation_digest":"sha256:5be08475ed16fe3f7fc5ab3baf5a707d7a59d56e01cb62fb8b4abc76b5b80be0","observation_id":"d3e9cd2b-d5c0-4f69-95ba-b880f9ae19bc","resolution":{"observed_at":"2026-08-11T18:16:26.681696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-11T18:03:57.147196Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08291","last_updated":"2024-12-11T11:07:50Z","snapshot_observed_at":"2026-08-12T01:44:43.382276Z","submitted_at":"2024-12-11T11:07:50Z","title":"Code LLMs: A Taxonomy-based Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:57.147196Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2412.08291"},"observation_digest":"sha256:eb52b9af622b2c59f2b6c41813023b57642428d75fa6203bc07b35a2c5b85633","observation_id":"63495120-6e32-4cfd-a125-a2cedc611067","resolution":{"observed_at":"2026-08-11T18:03:57.147196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-11T16:41:11.139620Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09879","last_updated":"2025-05-31T22:14:36Z","snapshot_observed_at":"2026-08-13T05:40:35.724346Z","submitted_at":"2024-12-13T05:50:22Z","title":"On the Limit of Language Models as Planning Formalizers","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T16:41:11.139620Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2412.09879"},"observation_digest":"sha256:7281be875ea38bff2bc6bcb707efa58a6b96721d249f3586ec149da4bd214a9b","observation_id":"edf61a2f-d584-47d1-97c1-1a56428d139f","resolution":{"observed_at":"2026-08-11T16:41:11.139620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-11T05:39:29.880683Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17315","last_updated":"2024-12-23T06:17:11Z","snapshot_observed_at":"2026-08-13T01:39:48.155951Z","submitted_at":"2024-12-23T06:17:11Z","title":"CodeV: Issue Resolving with Visual Data","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T05:39:29.880683Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2412.17315"},"observation_digest":"sha256:483344096eba020543563820bd4846ca9aad2ba306a9a9fe1533e083fca67c08","observation_id":"ba2c3add-a3ea-4529-8d8a-4ec616d75e43","resolution":{"observed_at":"2026-08-11T05:39:29.880683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-10T22:19:29.075540Z","title":"J., Feldman, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02086","last_updated":"2025-06-02T21:33:43Z","snapshot_observed_at":"2026-08-13T16:31:52.002293Z","submitted_at":"2025-01-03T20:19:14Z","title":"Instruction-Following Pruning for Large Language Models","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:29.075540Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2501.02086"},"observation_digest":"sha256:6352c1166f0b838f4fc6bf0950530c7eca576396260f3d874586a744726f5981","observation_id":"eab8472a-0f9c-4082-a7f1-7396a547589d","resolution":{"observed_at":"2026-08-10T22:19:29.075540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-10T15:43:03.027496Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13742","last_updated":"2025-01-23T15:17:51Z","snapshot_observed_at":"2026-08-12T06:21:13.627913Z","submitted_at":"2025-01-23T15:17:51Z","title":"An Empirical Study of Retrieval-Augmented Code Generation: Challenges and Opportunities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:43:03.027496Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2501.13742"},"observation_digest":"sha256:1e3010f4514c3bf485eacad173cbc084bd1c3e0310f0b17334023c30dbda3141","observation_id":"89818690-6712-48b7-9bef-ea0c78aabcb7","resolution":{"observed_at":"2026-08-10T15:43:03.027496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-08-13T00:38:34.374692Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-05-13T17:30:02.803757Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2502.02737"},"observation_digest":"sha256:73b525b686910312ebafe9f5bcf4bdbb06444f229f9c26f11c439e704767922c","observation_id":"9c862b68-9df5-48f0-8b77-1af04008f362","resolution":{"observed_at":"2026-05-13T17:30:02.924503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-08T16:26:32.068824Z","title":"J., Feldman, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06215","last_updated":"2025-02-10T07:33:49Z","snapshot_observed_at":"2026-08-13T19:59:18.728800Z","submitted_at":"2025-02-10T07:33:49Z","title":"LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T16:26:32.068824Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2502.06215"},"observation_digest":"sha256:d3c011394b8fddf15fc372769e8de7cbe24f8425cc34585ca52cfbe1fe7a95d0","observation_id":"c0093bee-6441-4fec-988d-22238b0e5997","resolution":{"observed_at":"2026-08-08T16:26:32.068824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-07T15:29:49.670235Z","title":"Feldman, Arjun Guha, Michael Greenberg, and Abhinav Jangda","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15023","last_updated":"2025-05-21T02:13:11Z","snapshot_observed_at":"2026-08-13T19:14:29.211985Z","submitted_at":"2025-05-21T02:13:11Z","title":"Towards a Science of Causal Interpretability in Deep Learning for Software Engineering","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:29:49.670235Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2505.15023"},"observation_digest":"sha256:111f3e7be4dac818f19791da955cec5b12293a7dba6b510007c878c5e3d15b87","observation_id":"b433847b-73ec-43e4-95e8-cdc00ff52f7f","resolution":{"observed_at":"2026-08-07T15:29:49.670235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-07T12:29:17.854881Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-13T04:31:11.811028Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.854881Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:369e9e64230f8a267b4af2b6fbbb31cb4c13d747bdea02f2f84ad8481af51705","observation_id":"87e2efdb-0046-440d-9965-ce658358a6ec","resolution":{"observed_at":"2026-08-07T12:29:17.854881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-07T04:30:43.590827Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10525","last_updated":"2025-06-12T09:43:48Z","snapshot_observed_at":"2026-08-13T17:13:53.892784Z","submitted_at":"2025-06-12T09:43:48Z","title":"AdaptiveLLM: A Framework for Selecting Optimal Cost-Efficient LLM for Code-Generation Based on CoT Length","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:30:43.590827Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2506.10525"},"observation_digest":"sha256:a6c5613a074e90a9576e7d0215f31f9073d334d9fdec29bec2a13e65c767b7c7","observation_id":"d7019c4b-ba3f-410e-a2fa-98961a55c0e3","resolution":{"observed_at":"2026-08-07T04:30:43.590827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-06T23:20:20.600047Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18796","last_updated":"2025-06-23T16:03:32Z","snapshot_observed_at":"2026-08-13T21:22:26.459616Z","submitted_at":"2025-06-23T16:03:32Z","title":"Context-Aware CodeLLM Eviction for AI-assisted Coding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:20.600047Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2506.18796"},"observation_digest":"sha256:1512cf377d3a428efaa2c16a437b620b948f6d069bea968d6b4481b89d3f12b8","observation_id":"51b4cef8-aec5-4d8e-87ed-7da0de47cde5","resolution":{"observed_at":"2026-08-06T23:20:20.600047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-06T21:36:23.679977Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23762","last_updated":"2025-06-30T12:09:29Z","snapshot_observed_at":"2026-08-13T08:27:18.830708Z","submitted_at":"2025-06-30T12:09:29Z","title":"Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:23.679977Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2506.23762"},"observation_digest":"sha256:a5b55febe63fb2863678e91c29993f6cd21cc50c0094b9e4b78811aa7831e711","observation_id":"d79c2e7d-0f16-4eb4-91ee-76665084bdc5","resolution":{"observed_at":"2026-08-06T21:36:23.679977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-06T19:15:31.911884Z","title":"Multipl- e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06138","last_updated":"2025-07-08T16:20:43Z","snapshot_observed_at":"2026-08-09T09:48:26.239549Z","submitted_at":"2025-07-08T16:20:43Z","title":"Coding Triangle: How Does Large Language Model Understand Code?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:31.911884Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2507.06138"},"observation_digest":"sha256:e2fd2d33a480d336d80225393bffa8d81b972f539778634741a2a97b3826de36","observation_id":"39ed476d-e59e-4400-a5e9-5dad069ce0c9","resolution":{"observed_at":"2026-08-06T19:15:31.911884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-05T21:18:26.294753Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-13T18:27:17.620441Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:26.294753Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:04a1240ed6660b32e435ecc5f4eb02a8eed3ff8b6a4fdd5b2fd8c1153f99e31a","observation_id":"97742432-eee2-45d9-8f71-b792fa671509","resolution":{"observed_at":"2026-08-05T21:18:26.294753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-08-13T08:59:50.823205Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T11:33:32.568261Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2601.02780"},"observation_digest":"sha256:0d9ddf0090c5331d9c965e96c046faa880ef9b85090aa6ee8b367026284b8631","observation_id":"65c94b43-ce96-48f7-b8ca-36d854ada713","resolution":{"observed_at":"2026-05-12T11:33:32.647434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2604.06253","last_updated":"2026-04-06T19:26:13Z","snapshot_observed_at":"2026-08-11T19:38:58.711202Z","submitted_at":"2026-04-06T19:26:13Z","title":"FLeX: Fourier-based Low-rank EXpansion for multilingual transfer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T19:50:04.707303Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2604.06253"},"observation_digest":"sha256:b2b9638999465fab07c6170c765fcf8200a7f96a72a943f50af08b918df234f2","observation_id":"041508af-e0e6-4576-a07e-ce7a8f8fc705","resolution":{"observed_at":"2026-05-10T22:25:53.442333Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2604.12088","last_updated":"2026-07-30T19:39:21Z","snapshot_observed_at":"2026-08-13T05:31:18.759603Z","submitted_at":"2026-04-13T21:52:57Z","title":"Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:44:50.762366Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2604.12088"},"observation_digest":"sha256:d0daf4b548b45f5afd2567a1dcf7d6cd976390b4a4cd37bb31571c50f550f756","observation_id":"6a702406-1203-403c-a4d7-9d6a4e43e04d","resolution":{"observed_at":"2026-05-11T09:56:03.145255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-03T00:19:56.108802Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.12088","last_updated":"2026-07-30T19:39:21Z","snapshot_observed_at":"2026-08-13T05:31:18.759603Z","submitted_at":"2026-04-13T21:52:57Z","title":"Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T00:19:56.108802Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2604.12088"},"observation_digest":"sha256:35bad219edbf9db97b746bb4c110db6856af7dd5942c83feda4eb72bd01f1314","observation_id":"8b0ef50f-c145-495c-b96d-e7d67baef4ea","resolution":{"observed_at":"2026-08-03T00:19:56.108802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2604.16321","last_updated":"2026-02-25T07:55:49Z","snapshot_observed_at":"2026-08-11T00:05:01.451986Z","submitted_at":"2026-02-25T07:55:49Z","title":"LLM-Based Multi-Agent Systems for Code Generation: A Multi-Vocal Literature Review","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T19:52:49.324500Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2604.16321"},"observation_digest":"sha256:a5c111ec0c6662b8cfa4e5779735c5a61baabeb8272a7fa906bb82d221affff1","observation_id":"aba0ec63-3d1c-4dea-ad31-da87e812dcf3","resolution":{"observed_at":"2026-05-15T19:56:33.750408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2604.17010","last_updated":"2026-05-03T12:28:34Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T14:43:00Z","title":"Improving LLM Code Reasoning via Semantic Equivalence Self-Play with Formal Verification","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T06:47:55.926034Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2604.17010"},"observation_digest":"sha256:3bc089cd1221b55056b8ff6a85d2f312897f9feaa6d7cdcea2b489b4a9391aef","observation_id":"d0485bf0-4f79-4403-a644-59bb932e7edc","resolution":{"observed_at":"2026-05-10T06:51:46.287422Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2604.19826","last_updated":"2026-04-20T14:47:46Z","snapshot_observed_at":"2026-08-13T22:14:50.133721Z","submitted_at":"2026-04-20T14:47:46Z","title":"Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T04:21:39.637962Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2604.19826"},"observation_digest":"sha256:d4b5972933b9d3e4de0f68ce2c7580b0b6080574c90f7f17f0eed138b30935ea","observation_id":"0fc96fdc-fdc0-4d49-9490-052b971d6830","resolution":{"observed_at":"2026-05-11T12:01:05.329045Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2605.08366","last_updated":"2026-05-08T18:21:44Z","snapshot_observed_at":"2026-08-10T22:13:26.511622Z","submitted_at":"2026-05-08T18:21:44Z","title":"SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:07.557119Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2605.08366"},"observation_digest":"sha256:3ebbc1c9dc69ef8616e110573b9498de894b5e34f78d0750c3ac1afb1d97d477","observation_id":"d7527281-47b5-4fe4-8913-06b10116bfa6","resolution":{"observed_at":"2026-05-12T07:36:58.178943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2605.11887","last_updated":"2026-05-12T10:01:06Z","snapshot_observed_at":"2026-08-11T01:56:48.113342Z","submitted_at":"2026-05-12T10:01:06Z","title":"Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T05:38:31.094834Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2605.11887"},"observation_digest":"sha256:55f0a33ee141e9906fb90f2b6fc1cfb419b704fa13dc0bb5e764632af32c59d1","observation_id":"f6d60447-ce09-4d77-ae35-042e591483f3","resolution":{"observed_at":"2026-05-13T05:42:21.082359Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2605.15238","last_updated":"2026-05-14T03:18:16Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-14T03:18:16Z","title":"Hydra: Efficient, Correct Code Generation via Checkpoint-and-Rollback Support","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T16:33:34.343796Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2605.15238"},"observation_digest":"sha256:4d6f61974f76002d382b5856ec6dfa7089d3e5f239696506c7765d6806f006cf","observation_id":"5d1945f9-8e87-4334-8287-02cc960f9925","resolution":{"observed_at":"2026-05-19T16:37:40.176613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2605.15815","last_updated":"2026-05-15T10:09:59Z","snapshot_observed_at":"2026-08-01T21:40:05.316602Z","submitted_at":"2026-05-15T10:09:59Z","title":"BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T17:04:07.449733Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2605.15815"},"observation_digest":"sha256:9583ef91f554e9764962da7688ca0598b541874a1089b08e4e10728c29e0d901","observation_id":"ae278ee2-a9f4-4bf5-b879-bbf44793dc73","resolution":{"observed_at":"2026-05-20T17:08:41.969898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:b10a549271a7692616a481ee596a776ededca5f1713960162fd2ba7687b7f117","observation_id":"090c46dc-5e5f-4efd-bf25-0dc56501c3f1","resolution":{"observed_at":"2026-06-29T19:23:54.143475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2605.28500","last_updated":"2026-05-27T14:01:30Z","snapshot_observed_at":"2026-08-03T16:15:08.120077Z","submitted_at":"2026-05-27T14:01:30Z","title":"Functional Entropy: Predicting Functional Correctness in LLM-Generated Code with Uncertainty Quantification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:23:01.482449Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2605.28500"},"observation_digest":"sha256:ae7717b817f6ec8848f33b7a5b714bd535896baea8a334c8487f6e5da3364d74","observation_id":"bf5c8108-ad02-446c-b7a3-d0b32069b8dc","resolution":{"observed_at":"2026-06-29T13:23:27.742271Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2606.07085","last_updated":"2026-06-05T09:31:21Z","snapshot_observed_at":"2026-08-07T10:31:00.677673Z","submitted_at":"2026-06-05T09:31:21Z","title":"Porting Declarative UI to HarmonyOS: A Heuristic-guided LLM Approach","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T21:28:00.813710Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2606.07085"},"observation_digest":"sha256:37c4a4ac8e546153895219a62c4c343016f441402a6bc956d369bd6649c2aead","observation_id":"49a89c34-db48-4d51-8f34-c53829fca4bb","resolution":{"observed_at":"2026-07-02T19:37:18.927927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2606.15079","last_updated":"2026-06-13T03:21:49Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-13T03:21:49Z","title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","version":1},"reference_index":183,"source":"arxiv_source","source_observed_at":"2026-07-02T22:10:59.568675Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2606.15079"},"observation_digest":"sha256:748d11fdaefd43ceb3660f5f04e1c6173daaaa298c078aeb2103b17e93aa1562","observation_id":"caf117cf-3aa1-4a29-abad-5d5dac84f78c","resolution":{"observed_at":"2026-07-02T22:17:25.586047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-02T13:53:03.342870Z","title":"and Guha, Arjun and Greenberg, Michael and Jangda, Abhinav , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18260","last_updated":"2026-05-16T02:55:06Z","snapshot_observed_at":"2026-08-10T17:50:43.864877Z","submitted_at":"2026-05-16T02:55:06Z","title":"FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T13:53:03.342870Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2607.18260"},"observation_digest":"sha256:9511d20591acd66beeff415a9bd1a665853a07af3f82dfd5167a67dbf20a9860","observation_id":"d612cc47-3909-41de-b7e0-6c70d99a0fa7","resolution":{"observed_at":"2026-08-02T13:53:03.342870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-01T04:26:46.342292Z","title":"and Guha, Arjun and Greenberg, Michael and Jangda, Abhinav , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27630","last_updated":"2026-07-30T03:42:18Z","snapshot_observed_at":"2026-08-04T10:21:42.087872Z","submitted_at":"2026-07-30T03:42:18Z","title":"SCOPE: Synthetic Conditional Objectives for Policy Evolution in Black-Box Combinatorial Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T04:26:46.342292Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2607.27630"},"observation_digest":"sha256:d946093c377f09e2542b6d67a4ae2ce27f8239d84a82b2fbf472ccf0d84e181f","observation_id":"199f1d7c-8401-4a15-88c9-ef66789762df","resolution":{"observed_at":"2026-08-01T04:26:46.342292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2208.08227/citation-record","integrity":"/paper/2208.08227/integrity","json":"/paper/2208.08227/citation-record.json","paper":"/paper/2208.08227"},"outbound":[],"paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T14:43:58.557701Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 37 inbound Pith citation observations for arXiv:2208.08227."}