{"as_of":"2026-08-18T07:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66b64503773bd7890fcfd0309f50f27f1306946c62f92cd727924aa64bb1b184","coverage":[{"denominator":161,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T05:16:58.549058Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:53:08.900571Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07619","snapshot_observed_at":"2026-08-01T10:53:08.900571Z","title":"Li, X.; Wang, A.; Wang, G.; Li, J.; and Shum, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27271","last_updated":"2026-07-29T11:39:55Z","snapshot_observed_at":"2026-08-16T09:59:32.410974Z","submitted_at":"2026-07-29T11:39:55Z","title":"RLPF: Reinforcement Learning from Performance Feedback for Code Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T10:53:08.900571Z"},"links":{"cited_paper":"/paper/2607.07619","citing_paper":"/paper/2607.27271"},"observation_digest":"sha256:f93a53c553ae845e64b59b113f4ee06a6960f320a68e9ebcd7bb6d77a5d20e86","observation_id":"1b53eb0d-ebe6-4be9-9aee-8b7a819913ef","resolution":{"observed_at":"2026-08-01T10:53:08.900571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.07619/citation-record","integrity":"/paper/2607.07619/integrity","json":"/paper/2607.07619/citation-record.json","paper":"/paper/2607.07619"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:06:17.155439Z","title":"Breakthroughs in statistics: Methodology and distribution , pages=","venue":null,"work_id":"962860c9-1d4e-4316-ade5-0893cdae1394","year":1992},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:9ddb64a99210c9faa07dcd998ee892124084a35c9d3959b26ed845aa037908f6","observation_id":"3dc05d99-6545-4cb5-8cb8-6cb59d2262ad","resolution":{"observed_at":"2026-07-09T05:36:01.148720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10664-021-10072-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"author Ralph, P","venue":"Empirical Software Engineering","work_id":"2dccb941-96a8-456e-be4d-60a993b2b026","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2734503760494f92b788ca09774759364be5d61866a751a4974e2e617e0ddf91","observation_id":"acfb784e-67c3-47a4-8f9a-c293c511fe68","resolution":{"observed_at":"2026-07-09T05:26:01.109354Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:25.901158+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:25.901158+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.214660Z","title":"Educational and psychological measurement , volume=","venue":null,"work_id":"8393005b-33e9-4f9a-94fe-99344b92fa62","year":1960},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c9d99fa9bfbebb058c3be857139bd878355d498aa4c8557e4d6efbc56ea8cd92","observation_id":"d34e65bf-9ed2-471e-9233-913e05179d33","resolution":{"observed_at":"2026-07-09T05:36:01.216623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:56:27.606265Z","title":"Biometrika , pages=","venue":null,"work_id":"955184f9-b809-4e79-9d26-bcd54dcaa395","year":1908},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2f7f51ea3090b2967d06e9c81da960db1147dfb550aed3cf474820e715af7b3c","observation_id":"fe24e569-5235-495e-8778-02cb696b51be","resolution":{"observed_at":"2026-07-09T05:36:01.163104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.221322Z","title":"Breakthroughs in statistics: Methodology and distribution , pages=","venue":null,"work_id":"f32386cb-5621-4596-9845-9b9fa070bc01","year":1970},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:6326c37f9aed90ab7bf51c47ca5a613c52f5738cdb25552d513ca4ffb5084a3d","observation_id":"fd78b4db-1995-47ae-9a75-a254d04906e1","resolution":{"observed_at":"2026-07-09T05:36:01.223370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.120840Z","title":null,"venue":null,"work_id":"146daab0-5977-41b2-8fab-3134a51db2e4","year":1900},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:4e39463273b9fa25e8182fd144c6ba301ebcd0574f7106ae75c4d7beadea62f4","observation_id":"dca09601-3147-446f-80d2-1c4acc0cdea6","resolution":{"observed_at":"2026-07-09T05:46:02.122374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.266105Z","title":"IOWA , author=","venue":null,"work_id":"331018a6-549d-4206-a04e-0bd08f8d04bc","year":1989},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:676525cc29ca53c0dfbf04d9b09d0fca394eb675e360c69250ebfa0a2e97a3db","observation_id":"f9d0b908-ac58-463c-8952-ae9b9214289b","resolution":{"observed_at":"2026-07-09T05:36:01.267905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.646008Z","title":"Biometrika , volume=","venue":null,"work_id":"dae55a61-08c0-4b31-bfa5-46d4c1673705","year":1947},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:684cec0fd63f1f780cb323cdfc7613aaabf217eb9beb684931533572c14f71c3","observation_id":"bec1610c-c54d-4c47-8e4f-25402746903e","resolution":{"observed_at":"2026-07-09T05:36:02.647556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.648392Z","title":"2009 , publisher=","venue":null,"work_id":"26f5b3cb-ed7e-42f5-a988-e4e0a5c7885a","year":2009},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:bf9700012593397d0d15e7081d089b648d39d97b1249ac363786aa31e6081b03","observation_id":"8b607199-d697-40fe-b552-57c8dc90bda7","resolution":{"observed_at":"2026-07-09T05:36:02.649714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.635017Z","title":"Information and Software Technology , volume=","venue":null,"work_id":"913e235c-3c6e-444b-b557-ce8b1f85ea45","year":2007},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:459ea6a424d18e03ce089b0480a541b9a3024d38a2a5f7541c9ef6a16c7c712b","observation_id":"1e8f7f04-8804-41ce-9993-36935cbda212","resolution":{"observed_at":"2026-07-09T05:36:02.636423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.653076Z","title":", author=","venue":null,"work_id":"02c4e005-0d71-4d4b-8db0-aed2e1c02df2","year":1993},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:97c9e39a1cd86e72cec8b2ee420b304fac2d28dec93bc219a22b77cbec71f637","observation_id":"002f5173-df22-4d6c-93a8-ba36247a9163","resolution":{"observed_at":"2026-07-09T05:36:02.654341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:57:07.377082Z","title":"Biometrics bulletin , volume=","venue":null,"work_id":"d528032f-514a-4f63-8d4a-c6910bb5d58d","year":1945},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:29c70d809db603238601f53df2cecaea14abadc2d9710091966b4107752124a4","observation_id":"ce30ab09-cb96-419f-8948-5d2a941fd5aa","resolution":{"observed_at":"2026-07-09T05:46:02.088696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.610109Z","title":"The Journal of Nervous and Mental Disease , volume=","venue":null,"work_id":"d87b0fdf-8e29-4135-a3f3-45496ce51262","year":1957},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d39a6142c6e2a90f1b1dc350ee435bb37fb4f76a5f0ec6f24029485d47c59b18","observation_id":"c70f330e-d95a-4f5f-8be0-065ba12e66f3","resolution":{"observed_at":"2026-07-09T05:36:02.611608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6628.2025","doi":"10.1109/msr66628.2025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Devanbu, Christoph Treude, and Michael Pradel","venue":null,"work_id":"52282e0f-2551-44cd-8740-aeb6b8647f0f","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:f3798e087d5428cc34501ed1b8db60f8dd640ba090e7acc09299d38b65f40007","observation_id":"da3d9738-4d0e-4556-a515-442a6ea6a0e6","resolution":{"observed_at":"2026-07-09T05:26:01.136701Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.16594","doi":"10.48550/arxiv.2411.16594","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From generation to judg- ment: Opportunities and challenges of llm-as-a-judge","venue":"arXiv (Cornell University)","work_id":"6654304a-22e0-4b16-93cf-36e7fc38ae5a","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:693f152033a6bac359360815c154b751468d48b3ee90eeb296b4ddaf98da822f","observation_id":"da2efc50-d426-43e3-b0ad-b580e25bcdc7","resolution":{"observed_at":"2026-07-09T05:26:01.089108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:26.997979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:26.997979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0457.368807","doi":"10.1145/3640457.3688074","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 18th","venue":null,"work_id":"5b3b6918-d9c6-46a1-9de1-e01d05f464b1","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d96f25c72f48c987d24a3f33d6709edbcf426b529fef6d793cc8034d17be1bcc","observation_id":"d63cd483-321c-4a1e-8dc5-6f159ee94db9","resolution":{"observed_at":"2026-07-09T05:26:01.174380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.149730Z","title":"DeepSeek Chat , howpublished =","venue":null,"work_id":"8b5dcd84-153f-402b-a594-011e01d3e137","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:b4e617149437f866859fc32c3b4f8e1fb01201c32ceae636d4fa94e6de06f8fb","observation_id":"75bd5282-35ce-4f69-845b-02fd26065bbb","resolution":{"observed_at":"2026-07-09T05:36:01.151418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.237762Z","title":"DeepSeek Model , howpublished =","venue":null,"work_id":"104eccd0-b096-40fe-96e4-a70c1d5e5716","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:ed102f0887ec789c06f89043359171b072dc6fb0bcb012fc3a2550e1a70409ac","observation_id":"09eaa7ce-a107-4eb9-a789-4b29ab00c273","resolution":{"observed_at":"2026-07-09T05:36:01.239298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.212023Z","title":"ChatGPT , howpublished =","venue":null,"work_id":"2e8e269e-a644-431a-a140-9afdeca5d781","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:b3d3badffa2080a40d4eca75ead1bc4159038ed11daac7c2b656f7452b8eeaeb","observation_id":"3593a4a1-49ef-4a1c-9e79-9e4a92269d0b","resolution":{"observed_at":"2026-07-09T05:36:01.213591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.232600Z","title":"Gemini25 , howpublished =","venue":null,"work_id":"6db726b1-23e8-4e66-a3ec-8f91facdcd3d","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:f86c51255ea3931a3cc60da409016b690d93a377d379c6a8e411f671ebc34e82","observation_id":"bf392ddf-d045-42a4-b749-b5adfa973bad","resolution":{"observed_at":"2026-07-09T05:36:01.234230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.170412Z","title":"claudesonnet45 , howpublished =","venue":null,"work_id":"4011437f-f328-4ef6-a170-37bde3ba0edd","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:3e9bc2bb1adff949baeff8f4ff41fd8d13d209141672c4dcc07e6f86e4df4497","observation_id":"67b7d851-4c75-4fd4-a8bb-392987f63ccd","resolution":{"observed_at":"2026-07-09T05:36:01.172238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.164112Z","title":", author =","venue":null,"work_id":"a71626d1-a320-4ef7-b2c0-eec6afa2c3fd","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:e684ce19d2643c7afd033c59eae6746f53179d1a5656653453ee394d04c76e0e","observation_id":"cd2ee14b-3790-4f90-8531-b80ed1616774","resolution":{"observed_at":"2026-07-09T05:36:01.165779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.182898Z","title":"Journal of Machine learning research , volume=","venue":null,"work_id":"f31d4fb2-85d3-4b14-b951-b14232e27f92","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:9f7049bf516500bf8b18eb24ce39eb762e61bd26b1ebdee507ec37dbea775159","observation_id":"fcc426f8-6dde-42e8-a42c-5f4e608b4cb8","resolution":{"observed_at":"2026-07-09T05:36:01.184980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.158159Z","title":"The annals of mathematical statistics , pages=","venue":null,"work_id":"b28ec081-85cb-4c46-8a3b-0992f53a755d","year":1947},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:df54289546fa564f0f18780eea214dbacec5e0164d72638fd03669bc8ac297e7","observation_id":"1232e5c0-4553-4a5c-94c3-179905eb8afc","resolution":{"observed_at":"2026-07-09T05:36:01.160417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.103932Z","title":null,"venue":null,"work_id":"bf514cb4-36f8-4848-884e-5ab2f906fe0d","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:3b1f4d56c9db4754d52b7edf5e7ff6752e498588b0baf67a9032d11dc69a06b2","observation_id":"131881fe-6e7f-40a8-b6fe-ed8246c091b4","resolution":{"observed_at":"2026-07-09T05:46:02.105787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.588730Z","title":null,"venue":null,"work_id":"ad0c432d-8ccf-4d0c-8e7d-a405e2f1e3da","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d519da5df38bcbfd2f2c11cd72a765aa3d296c4c89306cb734541e1cfcff97eb","observation_id":"9ecce98e-2188-4ac6-bf3c-97461a7e38b4","resolution":{"observed_at":"2026-07-09T05:36:02.590323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-naacl.197","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TestEval : Benchmarking Large Language Models for Test Case Generation","venue":null,"work_id":"e6666e1a-6b9a-4dcd-a91c-9b0f263f8aa9","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:db6ce8b77f742f0c67ffe085702d5e73b2cfeab148becfa53f8c85c9adbdb843","observation_id":"0c2f5bdd-b131-4300-b97b-c493b13a97e9","resolution":{"observed_at":"2026-07-09T05:26:01.182655Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-14T00:08:16.316386+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T00:08:16.316386+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.04295","last_updated":"2016-08-15T15:02:13Z","snapshot_observed_at":"2026-08-16T02:19:24.317292Z","submitted_at":"2016-08-15T15:02:13Z","title":"Robust benchmarking in noisy environments","version":1},"cited_work":{"arxiv_id":"1608.04295","doi":null,"metadata_source":"pith","pith_arxiv_id":"1608.04295","snapshot_observed_at":"2026-07-09T05:26:02.125184Z","title":"Robust benchmarking in noisy environments","venue":"cs.PF","work_id":"2f3836ca-cfa8-4a88-a80e-28d99ec5d81f","year":2016},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/1608.04295","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:95ef28cbd5bf31b6e5865d6536c489aede7bf1d603ec8a528b13e4d09c6689d7","observation_id":"f3a21cfc-654f-4d83-9484-3509ef71d1d8","resolution":{"observed_at":"2026-07-09T05:26:02.127013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8149.108819","doi":"10.1145/1088149.1088190","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 19th Annual International Conference on Supercomputing,","venue":null,"work_id":"575814ec-9c09-49ff-9157-4c9c4e50d71d","year":2005},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:74e8db414332fd2774981c0a4f5a98c570e9fa42ca8fcf3c00052b36578b4fbf","observation_id":"175216fa-9799-409d-8d00-9b4c47baa496","resolution":{"observed_at":"2026-07-09T05:26:01.118433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:28.509145+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:28.509145+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6972.106982","doi":"10.1145/106972.106982","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mogul and Anita Borg , title =","venue":null,"work_id":"9822b84f-e695-45b8-a767-3b3dcd64a8d9","year":1991},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c688253560f7dc37932b9f924d7f62793e498a82f9c4a599a67c5ecfa9cb378c","observation_id":"a3e96f8d-0b26-4b8f-8f9e-fc2af429bed4","resolution":{"observed_at":"2026-07-09T05:26:01.179288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:28.993112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:28.993112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf03356746","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tyson and Matthew K","venue":"International Journal of Parallel Programming","work_id":"441a5fd9-19b7-4c9d-b6ff-21fc4713ffe6","year":1996},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2e83f8e9612c296f6dda24e6d173d41e592c86a99f52933d1950e27df81dcf64","observation_id":"2c1fe6bc-282b-45b7-9167-17afa9b8e7b7","resolution":{"observed_at":"2026-07-09T05:26:01.101433Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:29.443703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:29.443703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.604193Z","title":"Tyson and others , title =","venue":null,"work_id":"4bc9fe4a-e973-4e60-a2a4-b4b1e44540b8","year":1999},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:e8ba9c4f514b72f16be185cf71e28a46c31aa2fb564ac7f3c309513ba25f32fe","observation_id":"d410037b-3811-4b88-a02a-e2f338c29737","resolution":{"observed_at":"2026-07-09T05:36:02.605587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/12.752652","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"1999 , url =","venue":"IEEE Transactions on Computers","work_id":"8edd7b4e-5d9d-4bd8-b762-1ba9200e3cc6","year":1999},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c08ccfc3dd95ede71f06ae5f674097ec3bc3c13d4601093c47a315dc86225fbf","observation_id":"9a758395-9f83-4893-a6fa-41b9df04ceff","resolution":{"observed_at":"2026-07-09T05:26:01.081703Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:29.95489+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:29.95489+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.573752Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":"1252fdca-5909-49c2-83c3-cd66eb54c21f","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:3c68d13f4403a49a4dbbd60ef23a47f5fc09fe20274df55486910016e1c20ae7","observation_id":"c07b46fd-a812-47a1-a574-a2cc46901fe1","resolution":{"observed_at":"2026-07-09T05:36:02.575326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3715727","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the ACM on software engineering.","work_id":"dd35a466-7af5-40fa-bbe5-4722fea85882","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:4211061265971a4221ef1de53d5ae90d2ece5b3e8d4a183b5937b46e7227e490","observation_id":"3eddb141-00ad-4841-b88b-3a2aed730b3e","resolution":{"observed_at":"2026-07-09T05:26:01.018502Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:30.526928+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:30.526928+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15963","last_updated":"2024-09-29T05:03:25Z","snapshot_observed_at":"2026-08-16T23:08:12.927804Z","submitted_at":"2024-01-29T08:47:31Z","title":"NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness","version":3},"cited_work":{"arxiv_id":"2401.15963","doi":"10.48550/arxiv.2401.15963","metadata_source":"pith","pith_arxiv_id":"2401.15963","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InProceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 8647–8657","venue":"cs.SE","work_id":"26ab46a9-ed1e-4a22-bf52-e1daff58ba15","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2401.15963","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:19cbf690eb5608c103ea0c313b47e1f8d41095a42839b714213c89482fa1b77a","observation_id":"6f251ed2-c4c3-4a5f-ace8-0d11013bde83","resolution":{"observed_at":"2026-07-09T05:26:01.002164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:31.072404+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:31.072404+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.593535Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"09578760-f271-40bf-a872-b28c9666663f","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:fd193a39472795b64fc242b1757ff2c58f5f18c228406b3ace7f122c696f7a6e","observation_id":"e340eaad-bcae-43a1-8b69-8fb9a37cd780","resolution":{"observed_at":"2026-07-09T05:36:02.595190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.612460Z","title":"Proceedings of the ACM/IEEE 42nd International Conference on Software Engineering , pages=","venue":null,"work_id":"0f2b47f9-cedb-410e-8d08-303390cbbc48","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:81b0f7d283bf5a85858f69624d9a422bf9c5ca84c9c4ca51590e1c5a5f3c8ab0","observation_id":"8facd045-87ef-43d2-a3a5-1ab6d8c22dcc","resolution":{"observed_at":"2026-07-09T05:36:02.613991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.171389Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":"77db713f-99b6-4839-b1f0-bd73541d4b74","year":2020},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c48a41abeb63e494078ea4415acf8a1545cf598d3409c5db3e95ff3b669c79b9","observation_id":"6c939dc0-c918-492b-b3ab-5c1a90c9449a","resolution":{"observed_at":"2026-07-09T05:36:02.173007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.178664Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":"83c90b79-2649-45b4-b47a-3c3a1a3ae0ed","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:309a478ef24afc3e971b5a9695e507ed21567e19941e5c876f8d18d9f07037d4","observation_id":"907cc97e-f9cf-46b9-8692-dca6caa951ed","resolution":{"observed_at":"2026-07-09T05:36:02.180435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.579419Z","title":"Proceedings of the 38th international conference on software engineering , pages=","venue":null,"work_id":"1116a68e-52be-4ae0-a42d-60226427f36b","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:e62789b61986135955491b935883d6e942b058688fc0974db9cd263aa130e23d","observation_id":"cf6fe173-407d-4b1f-9d17-894d3ca4fc8b","resolution":{"observed_at":"2026-07-09T05:36:02.587304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.650496Z","title":"Journal of Systems and Software , volume=","venue":null,"work_id":"27b0ef35-2884-48df-a98b-71b9507b768f","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d964a3de516fc150ce2b18d606b7abaac4a672fd78d6adb4700cab484c05d976","observation_id":"ab3260c3-45c7-4c8f-b344-de75ed63c2f0","resolution":{"observed_at":"2026-07-09T05:36:02.652238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.176096Z","title":"Proceedings of the IEEE/ACM 46th International Conference on Software Engineering , pages=","venue":null,"work_id":"3990a3ea-9aff-49ec-af95-02a43f15ad32","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:0bb38189bb75722003442349092729be4374396adc2cb5fab41a02a298593e2d","observation_id":"f604e6a7-bd4d-43f0-a540-0fc5dfe46f29","resolution":{"observed_at":"2026-07-09T05:36:01.178117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.155291Z","title":"IEEE Access , volume=","venue":null,"work_id":"f513c666-7236-44c7-afe3-743289450761","year":2019},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:dee61d281d7fc2f3cf918eea69a7a56bfd2e3d115254e3835fcaab38b697192d","observation_id":"d0f53d18-cd9b-43c1-95a0-d8154c578290","resolution":{"observed_at":"2026-07-09T05:36:01.157088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.242621Z","title":"IEEE Access , volume=","venue":null,"work_id":"7ae24c89-dd46-43ca-bdb5-8411f0ce9b04","year":2019},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:718f216baada4a2a1dc1e68eab8dcba9c36785f3a98ced344ae9852f9d073794","observation_id":"20541f37-aae0-4864-b8b7-a454d2fb2bda","resolution":{"observed_at":"2026-07-09T05:36:01.244350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.195268Z","title":"2023 IEEE/ACM 45th International Conference on Software Engineering (ICSE) , pages=","venue":null,"work_id":"8ba70a4e-07c1-4746-89de-c2dfa477dcdd","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:5e3e47451f0f8c4c4126f9bb8c87bfba20dd1c20898d7749ef5dbfe1331e7858","observation_id":"2c420f38-9fab-47dc-80c3-f24f43f6dcd9","resolution":{"observed_at":"2026-07-09T05:36:01.197483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.173116Z","title":"Information and Software Technology , volume=","venue":null,"work_id":"63e3388f-5b98-4244-ba6a-b42db05ccad6","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:8ee6586d1a60ee57439fed64e5e9ac83bfd0e8e05a8dd606a1ac9cc6f34f5002","observation_id":"a56f1596-5f88-430a-b335-4129261f59bd","resolution":{"observed_at":"2026-07-09T05:36:01.175079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.083567Z","title":"2023 38th IEEE/ACM International Conference on Automated Software Engineering (ASE) , pages=","venue":null,"work_id":"0c8a4013-d40a-4c16-bf0d-e07ac142dc24","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d5654f46d750b61ced063865f3d66d3a0e44b4115c97fa1ed8a73c453a13a37a","observation_id":"8cb649b0-311a-4c5b-ba59-8b49f5673e4d","resolution":{"observed_at":"2026-07-09T05:46:02.085408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.179581Z","title":"Proceedings of the 33rd ACM SIGSOFT International Symposium on Software Testing and Analysis , pages=","venue":null,"work_id":"0dda9ea0-ba32-4677-b731-2e78b136df4b","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2e170dc9445e013185af6cc9fbcaed0e20e8f7beea35033a1f3004e1cdbcc236","observation_id":"7c37771a-cd44-45bf-942e-d1f762178006","resolution":{"observed_at":"2026-07-09T05:36:01.181727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.192224Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":"2c7fa5c1-bdfc-43a8-9f40-de29c928c858","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:601e988aaf6f2dae32bfe1e7ad34c8c3543146c6c42f423607e8894d25df2795","observation_id":"f547b1ae-5aab-4844-adab-55af4b30c67e","resolution":{"observed_at":"2026-07-09T05:36:01.194201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.209043Z","title":"Proceedings of the ACM on Software Engineering , volume=","venue":null,"work_id":"7651fdac-3acf-439e-9e9e-409856055b62","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d06dc5c40a136113a5ca9bd926c545c26b9560a1b36d7d3afcaa3f65b967e37a","observation_id":"e18e37f9-3f1f-445c-8073-72f0a1eb9358","resolution":{"observed_at":"2026-07-09T05:36:01.210964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.217588Z","title":"Proceedings of the 27th ACM SIGSOFT international symposium on software testing and analysis , pages=","venue":null,"work_id":"cc4b4b91-e89b-4d92-a247-7ea58269afdb","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2afb44c99013a942e597e5e781794a96c4fd029a81aafaeca8c3bc8a1e56737f","observation_id":"01a0de30-6fd4-4288-aea6-18978835a55c","resolution":{"observed_at":"2026-07-09T05:36:01.220351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.591245Z","title":"Proceedings of the 2017 ACM SIGSAC conference on computer and communications security , pages=","venue":null,"work_id":"76e55058-ebed-4e97-90fb-8332e733125b","year":2017},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:53d994d3276c0a3565b13bbe9f29d19000a38769acc7bfe62c7083abadc9178f","observation_id":"337665cb-881f-468d-adae-1c59ca0a4425","resolution":{"observed_at":"2026-07-09T05:36:02.592773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.166713Z","title":"Proceedings of the ACM/IEEE 44th International Conference on Software Engineering: Companion Proceedings , pages=","venue":null,"work_id":"9d07ae8b-56ef-41a2-b36c-c44aa2429be1","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:8ed71d2fc989e47c4228524163d80cc9bb6c3513879b171927da9c35a53678b8","observation_id":"7c554f65-41fd-4dfa-9a5e-9c05b416b4b7","resolution":{"observed_at":"2026-07-09T05:36:01.169194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.250417Z","title":null,"venue":null,"work_id":"dbb7428f-592b-4bef-b0cb-e0dee1ab3251","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:f08d8a63e6dcdda352a980f4eb4e3eb978ba5d25448b48992eb0cf1663c24e0b","observation_id":"4edbe300-8d74-452e-b799-8b5c334ab5e4","resolution":{"observed_at":"2026-07-09T05:36:01.251943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.272119Z","title":"Forty-second International Conference on Machine Learning,","venue":null,"work_id":"28e46ca7-9429-4545-861b-fb5bb25a0895","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:274744e463ece763d2cc32a2de7d54fc18eeb3e10011c8504803b80fadfa62a9","observation_id":"ed2840f6-bdff-48a1-8555-d6f1f08d9e4f","resolution":{"observed_at":"2026-07-09T05:36:01.274104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18489","last_updated":"2025-02-17T07:01:18Z","snapshot_observed_at":"2026-08-16T12:57:50.974860Z","submitted_at":"2025-02-17T07:01:18Z","title":"LLM4EFFI: Leveraging Large Language Models to Enhance Code Efficiency and Correctness","version":1},"cited_work":{"arxiv_id":"2502.18489","doi":"10.48550/arxiv.2502.18489","metadata_source":"pith","pith_arxiv_id":"2502.18489","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm4effi: Leveraging large language models to enhance code effi- ciency and correctness","venue":"cs.SE","work_id":"96cfe6bf-bed2-41c3-8192-599b036e173d","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2502.18489","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:b3ca6ebd3959c3c77e09024d396f52e22f56cfbd49be0fbbffdd569c4c505e80","observation_id":"4b7d47f7-e172-4a6e-8beb-f6c2375c95b2","resolution":{"observed_at":"2026-07-09T05:26:01.122754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:31.588021+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:31.588021+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20124","last_updated":"2025-08-24T16:47:19Z","snapshot_observed_at":"2026-08-14T23:52:14.311383Z","submitted_at":"2025-08-24T16:47:19Z","title":"Towards Better Correctness and Efficiency in Code Generation","version":1},"cited_work":{"arxiv_id":"2508.20124","doi":"10.48550/arxiv.2508.20124","metadata_source":"pith","pith_arxiv_id":"2508.20124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards Better Correctness and Efficiency in Code Generation","venue":"cs.SE","work_id":"ddf6f968-ec41-4691-af9b-cf4c4a22aa5b","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2508.20124","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:9e1186d5e9e0fb03ea44e5776877500de448d73f9c5275f40de02cf725f0a566","observation_id":"6bd5dfd4-3990-4fbe-bb1a-65a125f79080","resolution":{"observed_at":"2026-07-09T05:26:01.063164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:32.023945+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:32.023945+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.229885Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers),","venue":null,"work_id":"203615c4-1318-40db-acdf-2e19ea6e30e7","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:6b011aa909b7e96f75a91171de97fa21a32119f80424e09a584a6f38faf703db","observation_id":"222379f6-1f7c-441e-a3bb-67954cf7fff7","resolution":{"observed_at":"2026-07-09T05:36:01.231582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.358574","doi":"10.1109/access.2025.3585742","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , url =","venue":"IEEE Access","work_id":"efaff597-4523-433c-bc02-fdef396b1163","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2e73f3f74d2b81ac3b716ddf55c5577b1841b9660da53f422fad735b38e56824","observation_id":"363b706f-b518-43ef-9cac-f1d1d6850e6a","resolution":{"observed_at":"2026-07-09T05:26:01.131122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:32.532518+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:32.532518+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.106683Z","title":null,"venue":null,"work_id":"0c16ac67-bc31-47dc-973c-19afccbd5174","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:1acc557c75c1b9f7d81640ec35660f88af71f1b63664efdb520f1e824134b7e4","observation_id":"b7632066-662c-4420-b287-2253f7fe7a85","resolution":{"observed_at":"2026-07-09T05:46:02.108334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.050177Z","title":null,"venue":null,"work_id":"5f2e826f-ee01-4ecc-b6b8-d13c83f15110","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:153cc2a62c33d01a708c64d5be5aed47c843c4f26a11d248f91a9014ae570226","observation_id":"06895d48-b862-4717-8233-abc4ca6d2d21","resolution":{"observed_at":"2026-07-09T05:46:02.052193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.057655Z","title":"2025 , booktitle=","venue":null,"work_id":"4c7971b3-cca1-41e1-90f4-6a7a2ec00258","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2602d59b80cf0504b4d552763036e7f741576f019520cf984563c7e36297bf83","observation_id":"70a49bd6-6160-4d79-946c-c35cf4b57846","resolution":{"observed_at":"2026-07-09T05:46:02.059319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1186.321192","doi":"10.1145/321186.321192","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simon , title =","venue":"Journal of the ACM","work_id":"4587aaa0-62cb-4343-bc5f-f954e166ca7f","year":1963},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:134038c7b4e57a11584b49ba4e2c73e375857fc0b5e20afb67ef21fa87002c2d","observation_id":"9ef1df8e-ec1e-4bee-9e8d-20252471d1f1","resolution":{"observed_at":"2026-07-09T05:26:01.114097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:32.969761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:32.969761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.252828Z","title":"Shaw and others , title =","venue":null,"work_id":"7a2f47b1-aa55-4694-a5d9-8c596f5aab3b","year":1975},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c018180e111e885cd3d25f328cc41a9f0280c910ceae7b1d50fdddd78b54fe48","observation_id":"6e91cc5f-f75a-46df-93a2-85c12be4269c","resolution":{"observed_at":"2026-07-09T05:36:01.254539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6385.192642","doi":"10.1145/1926385.1926427","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: POPL (2011)","venue":null,"work_id":"ab5c76d6-dfb1-4003-9cc7-363ed842dbed","year":2012},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2145f051b97b74210f70c39363d21526c5eddfed66c682877834bbdd552b69f2","observation_id":"a4ce6a93-8519-483c-890c-d82f54fd5027","resolution":{"observed_at":"2026-07-09T05:26:01.039755Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-18T00:51:19.455381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T00:51:19.455381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.248105Z","title":"Waldinger and Richard C","venue":null,"work_id":"a3b31390-643f-48ee-8457-f6d0826c4ab5","year":1969},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:5ad79a7cbbc7b42ceeabe71b18eba38e81da7fc75fd1f464dc51770089d49f7a","observation_id":"3539dbfa-2e26-4f8d-b88e-affce2135793","resolution":{"observed_at":"2026-07-09T05:36:01.249679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2566.362568","doi":"10.1145/362566.362568","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Waldinger","venue":"Communications of the ACM","work_id":"476643d1-2396-4935-8922-a76e63fd2f21","year":1971},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:fc19d5fe4f008c277b3c3054b95f7ad7b8dafc33d85800440f87b60bbed2273c","observation_id":"aa4eb889-b347-463d-b1e1-154e5eacfd53","resolution":{"observed_at":"2026-07-09T05:26:01.054980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.914342+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.914342+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.206476Z","title":"Cordell Green , title =","venue":null,"work_id":"dbf423a3-d7c8-4db4-ac0f-df6a9b293343","year":1969},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2df654c4d7173c21e0252d013142c3ef25479c951867ea9de1ed3ca35eb283cf","observation_id":"05bdd701-2eb0-4ab0-a4e6-3ebecddc6bf2","resolution":{"observed_at":"2026-07-09T05:36:01.208084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.095016Z","title":"6th International Conference on Learning Representations,","venue":null,"work_id":"e1de89da-ad98-4c97-b82d-22a5d7a1c9ae","year":2018},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:5be3e5fbae89cc45f18b537f8cfe4169506bfda64d5ce67dd8f0728f399adf97","observation_id":"8d6accf6-d999-4443-981a-5e3bd4ade773","resolution":{"observed_at":"2026-07-09T05:46:02.096776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.189455Z","title":null,"venue":null,"work_id":"6a50dec6-3c59-4c83-8753-0eb65a45bcc0","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:db60a8632ed9b3818e351c85d9d62d70f37a714529a858621f8b1d7f9017b25e","observation_id":"b1611c7e-97d8-4a1d-9878-af02dc5d75e1","resolution":{"observed_at":"2026-07-09T05:36:01.191262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.077781Z","title":"Foundations and Trends","venue":null,"work_id":"48acbc34-9ac7-4be5-8487-473cd052ebcb","year":2017},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:8dc0b86d85f0aec6a3962d50d4d21d495cf1e850415460b7e97ef83172c60956","observation_id":"d026c53f-b64e-4bc8-a598-531dcee893f8","resolution":{"observed_at":"2026-07-09T05:46:02.079578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07814","last_updated":"2022-02-08T23:16:31Z","snapshot_observed_at":"2026-08-15T05:41:03.327624Z","submitted_at":"2022-02-08T23:16:31Z","title":"Competition-Level Code Generation with AlphaCode","version":1},"cited_work":{"arxiv_id":"2203.07814","doi":"10.48550/arxiv.2203.07814","metadata_source":"pith","pith_arxiv_id":"2203.07814","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Competition-Level Code Generation with AlphaCode","venue":"cs.PL","work_id":"00d9ab4d-e694-4677-8132-332873a8f9a7","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2203.07814","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:83e7d3cd1dead26f59dd2f7beb4a38dad28a9fed0d633fcfc2d5b26019101a6a","observation_id":"77e5cd76-c43f-48e6-868a-e6446d139c28","resolution":{"observed_at":"2026-07-09T05:26:01.144105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:34.328608+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:34.328608+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-08-13T14:36:56.609471Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":"2203.13474","doi":"10.48550/arxiv.2203.13474","metadata_source":"pith","pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","venue":"cs.LG","work_id":"892a192d-205a-4079-a807-00d7874b392e","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:a0454b4bc6eae8c63934ee2ba96e508a23d73a8339675817017de33e572e68cc","observation_id":"1247bc9e-46de-4ad8-bb8b-64a88aa3b93d","resolution":{"observed_at":"2026-07-09T05:26:02.119353Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.68","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In Proceedings of the Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, December, 2023, Singapore","venue":null,"work_id":"5084b60a-90d0-4510-bc14-97091bb61f88","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:e467b1b6af9e14eb847e93e0e325e2109e370404bf6016faf6293abaf7c56bb8","observation_id":"0cbfa65f-c166-427b-8a5a-03d1dc53dcfa","resolution":{"observed_at":"2026-07-09T05:26:01.066720Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:34.852909+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:34.852909+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.100279Z","title":null,"venue":null,"work_id":"b38dcafc-df26-43df-b85c-580b543f9d0f","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:b0a169a5c9792c0c498ba20e9be5d70a8eacfb8dcc78b8439a79d9ebbf3e7289","observation_id":"1cdf3c40-124e-4554-839a-8ac2652d59bf","resolution":{"observed_at":"2026-07-09T05:46:02.102413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.275105Z","title":null,"venue":null,"work_id":"77bf37b3-4f24-47d9-82a2-5bee1bad78a5","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d2ec63b0652f28632cdc5690e384afe5ad250f20bf88b68c54a2185b77d8cd67","observation_id":"bbe5679d-44b9-43ca-b627-2af5fb9ba813","resolution":{"observed_at":"2026-07-09T05:36:01.276676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05999","last_updated":"2023-04-09T14:31:40Z","snapshot_observed_at":"2026-08-13T02:34:38.117682Z","submitted_at":"2022-04-12T16:25:26Z","title":"InCoder: A Generative Model for Code Infilling and Synthesis","version":3},"cited_work":{"arxiv_id":"2204.05999","doi":"10.48550/arxiv.2204.05999","metadata_source":"pith","pith_arxiv_id":"2204.05999","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InCoder: A Generative Model for Code Infilling and Synthesis","venue":"cs.SE","work_id":"e98a5559-529d-48b1-833c-b85b662f190c","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2204.05999","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2e3b9e6ec5ed6265401db4f54a403198114b0bf9460c1477fc69ea3b7b70f217","observation_id":"b4645939-b944-485e-9a44-f72731931aab","resolution":{"observed_at":"2026-07-09T05:26:02.096721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03988","last_updated":"2023-02-24T09:53:40Z","snapshot_observed_at":"2026-08-16T16:03:40.539365Z","submitted_at":"2023-01-09T10:52:35Z","title":"SantaCoder: don't reach for the stars!","version":2},"cited_work":{"arxiv_id":"2301.03988","doi":"10.48550/arxiv.2301.03988","metadata_source":"pith","pith_arxiv_id":"2301.03988","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Santacoder: don’t reach for the stars!","venue":"cs.SE","work_id":"bf393c50-a11b-4a0f-8513-52428ede71f7","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2301.03988","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:bc7d01befba4f004426c430752fd450ce9c17aa6462f3f72b6ca9150773b060f","observation_id":"70853840-a8d6-487a-ab3d-982586435e2d","resolution":{"observed_at":"2026-07-09T05:26:01.048861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:35.396233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:35.396233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2f42881acd2c61db19469c888a3e048ba7a9279d3e1a0fe51275954625e92d82","observation_id":"bc90ff6c-ec32-4bb3-96a4-d14ecf167a69","resolution":{"observed_at":"2026-07-09T05:26:02.115697Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c2caa882cc1e167818c3c95ccbfbda78000dc9ad7934f1c314b111a23dbf2a91","observation_id":"0cb8bd0c-01d1-42e8-873a-6479ea1e19a0","resolution":{"observed_at":"2026-07-09T05:26:01.126601Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2d6df6a1251bd4b9c5f287cc5b48375dac5ee772e52a7108d618f608fe10d078","observation_id":"654025cc-6061-4682-bf08-567956349037","resolution":{"observed_at":"2026-07-09T05:26:00.996749Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00788","last_updated":"2024-01-01T15:30:19Z","snapshot_observed_at":"2026-08-18T07:05:42.628973Z","submitted_at":"2024-01-01T15:30:19Z","title":"Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models","version":1},"cited_work":{"arxiv_id":"2401.00788","doi":"10.48550/arxiv.2401.00788","metadata_source":"pith","pith_arxiv_id":"2401.00788","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Astraios: Parameter-efficient instruction tuning code large language models","venue":"cs.CL","work_id":"67bf8efc-a5db-4dcd-afa0-4c2283efcfbb","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2401.00788","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:df582332f23950945f2056812634b401d16a5bae35e9db6c4c8c72afc8f38ccd","observation_id":"63158b33-9d39-4c6d-b802-5857273c2c2d","resolution":{"observed_at":"2026-07-09T05:26:01.075601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:37.34905+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:37.34905+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:dc4fe1e9e18dd54998649a62147535319bb2a001d84074c1e6139aa0281a369b","observation_id":"c2a040a2-0cf0-41b5-9465-f474eb124094","resolution":{"observed_at":"2026-07-09T05:26:01.148862Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.637390Z","title":"Llama , howpublished =","venue":null,"work_id":"92723ce4-8e6e-4fe4-8d59-e07fc9703264","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d27f85ec86ea9402ca12e8c3f6d7f742e9c25d1f3dc9ad55676bab50ea66b9a4","observation_id":"8558cbea-3730-4633-b8c1-e8a1a81d565f","resolution":{"observed_at":"2026-07-09T05:36:02.638824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.630401Z","title":"Anthropic , howpublished =","venue":null,"work_id":"e1d37e54-b496-4301-8dd9-d5e7227e6ee3","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:33494e0662bdd805c67eab013237354cebf6907547495ad2683f97ba0a8471e1","observation_id":"857b7a33-6bc3-421a-b3af-88b9b30255b7","resolution":{"observed_at":"2026-07-09T05:36:02.631833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:742d062cbde6fffc0d22fb108be8611b767cce39818b32e8321562a4b0694c6f","observation_id":"b642fd0b-5eb1-4abd-93ad-ad2cf96c0cbc","resolution":{"observed_at":"2026-07-09T05:26:01.015668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:816d7e6b81593a405f69848c0d01e495ab832c7550caaf84e0bbaebd131ac495","observation_id":"55bd9041-6d7d-4cca-8e49-ec24a0677a41","resolution":{"observed_at":"2026-07-09T05:26:01.010795Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5347.2025","doi":"10.1109/icse55347.2025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.IRFuzzer: Specialized Fuzzing for LLVM Backend Code Generation","venue":null,"work_id":"c383b7e9-bd1e-4268-b134-a4e43d7560a3","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:91d7ae41dc9765aedafeac3ce0de8b4f782c8651db3d0d007d06ae5a2936834f","observation_id":"e164568e-c3d3-4981-91e2-85f1d44d3d52","resolution":{"observed_at":"2026-07-09T05:26:01.105667Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.13535","doi":"10.48550/arxiv.2509.13535","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crash report enhancement with large language models: An empirical study,","venue":"ArXiv.org","work_id":"99f03577-046b-4709-8771-457484be52ce","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:ae78a51a3232a89440922bef3f2ce2ed9220de748ed2ca4e25e56a0c11ca18ab","observation_id":"8d769afd-e257-4eac-977b-2723e0160da7","resolution":{"observed_at":"2026-07-09T05:26:00.990580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:40.217731+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:40.217731+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.632685Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":"92e1e086-9e03-4224-bcc0-937bf199012f","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:239c125eb98d877e7c4296896224d9ae39971d5fa880e19b2db92b8846cbc740","observation_id":"99af4452-8485-45f8-a4f7-43892cf8e401","resolution":{"observed_at":"2026-07-09T05:36:02.634196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.639661Z","title":"Proceedings of the 29th International Conference on Evaluation and Assessment in Software Engineering , pages=","venue":null,"work_id":"7943d3c7-8362-4dc9-a5c7-97b054369a32","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:f566ec6a4160a538c6756d6b0c2865966da4c65c5d77454b1256422c2e5efbe2","observation_id":"1382c003-154e-4081-8fdd-0f9514fdc0a8","resolution":{"observed_at":"2026-07-09T05:36:02.641152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.625438Z","title":"Proceedings of the 29th International Conference on Evaluation and Assessment in Software Engineering , pages=","venue":null,"work_id":"798d3e50-06af-444a-a932-da983f5caaad","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:3044104de491ead3109905f15cecdccd6b5ded6c677c91ef59faec2f19b87439","observation_id":"b6d9865a-4ec0-49c2-ab5e-0d9244f2a7ba","resolution":{"observed_at":"2026-07-09T05:36:02.627088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.627944Z","title":"Proceedings of the 2024 IEEE/ACM First International Conference on AI Foundation Models and Software Engineering , pages=","venue":null,"work_id":"656bddf3-8fc6-43b4-a8ee-53b3437ae3c4","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:f6b6429f0c47f7493d5a1f436d300832ac16060c7466ee16589c8e468f279aeb","observation_id":"cac72df3-d98a-4078-a8e4-1c51ad67112e","resolution":{"observed_at":"2026-07-09T05:36:02.629457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14504","last_updated":"2024-08-24T07:40:22Z","snapshot_observed_at":"2026-08-16T13:24:10.077357Z","submitted_at":"2024-08-24T07:40:22Z","title":"Is Functional Correctness Enough to Evaluate Code Language Models? Exploring Diversity of Generated Codes","version":1},"cited_work":{"arxiv_id":"2408.14504","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.14504","snapshot_observed_at":"2026-07-09T05:26:02.132005Z","title":"Is functional correctness enough to evaluate code language models? exploring diversity of generated codes","venue":"cs.SE","work_id":"3349e5b9-a9dc-4ea6-9193-fe484abb2a31","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2408.14504","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:6d11a717ffaa443597b88328f95c7c79b660cf5c3429a5cc2c1cbb8d5ea45f52","observation_id":"b4b288dc-4b9e-4073-bd4b-64da2a3d7d92","resolution":{"observed_at":"2026-07-09T05:26:02.133748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.641960Z","title":"ACM Sigplan Notices , volume=","venue":null,"work_id":"53286cc2-dd30-4e9a-9f1c-f9d73a5924b8","year":2009},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:a62be591640bb7af38179b103bbd76672a9dad8e43bb5bc7e658c05135b26804","observation_id":"b6792b08-cc59-40e8-bedd-e0c0deab4fb0","resolution":{"observed_at":"2026-07-09T05:36:02.645017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.655033Z","title":"ACM SIGPLAN Notices , volume=","venue":null,"work_id":"35273b71-50fa-4e6d-8dea-8414769991fc","year":2007},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:1bd20f984d6f6ccb74f3b3264d60531e0c2f199bbaea8a6687fc86df4488890b","observation_id":"e544fd1b-0ea2-4ed6-95f3-3c842f4804c7","resolution":{"observed_at":"2026-07-09T05:36:02.656462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.607761Z","title":"ACM SIGARCH Computer Architecture News , volume=","venue":null,"work_id":"8a686798-6afb-4e77-bb01-dad970304504","year":2013},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:b65923a9a2d9054aae1df076ed5abe97426065984ff3f95e856d9c9374c60c4b","observation_id":"7c261bed-8a12-4839-bacf-c4da5422c85a","resolution":{"observed_at":"2026-07-09T05:36:02.609232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06450","last_updated":"2024-08-12T18:59:13Z","snapshot_observed_at":"2026-08-16T13:26:54.745068Z","submitted_at":"2024-08-12T18:59:13Z","title":"Evaluating Language Models for Efficient Code Generation","version":1},"cited_work":{"arxiv_id":"2408.06450","doi":"10.48550/arxiv.2408.06450","metadata_source":"pith","pith_arxiv_id":"2408.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating language models for efficient code generation","venue":"cs.SE","work_id":"09560849-dba2-488c-9af2-3ca599c7f32f","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2408.06450","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:ebe080a6e54be667d9661e193a920cd461226f1f7ffade7a70783664170e0c7e","observation_id":"2c284cb9-cfad-49e7-a13b-aa1c28eee140","resolution":{"observed_at":"2026-07-09T05:26:01.186731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:40.674264+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:40.674264+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.567653Z","title":null,"venue":null,"work_id":"469ea475-759d-4569-a915-13d3f7aa4de1","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:1717bd4c730d185282234ef3c90a159800cbdcaaf625ac8a200f883219f3f972","observation_id":"ef2278a7-81c0-4b47-b429-ec0ac5164477","resolution":{"observed_at":"2026-07-09T05:36:02.569738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-12T12:58:27.355007Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":11,"parse_uncertain":0,"unresolved":10,"verified_exact":23,"verified_fuzzy":56},"total_outbound_references":161},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 161 outbound references and 1 inbound Pith citation observation for arXiv:2607.07619."}