{"as_of":"2026-08-17T16:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2229c0a7ef3c8c9621897dcfcdfef9943cc4f469c40d2b30dcd4f01ce0be9397","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T18:34:39.997353Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:40.967694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T12:43:25.368479Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"cited_work":{"arxiv_id":"2605.13139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.13139","snapshot_observed_at":"2026-06-29T12:43:25.368479Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","venue":"cs.SE","work_id":"c2c8a81b-bfc8-40c4-b975-12358fedeed6","year":2026},"citing_paper":{"arxiv_id":"2605.28424","last_updated":"2026-05-27T12:54:33Z","snapshot_observed_at":"2026-08-15T05:22:49.474801Z","submitted_at":"2026-05-27T12:54:33Z","title":"Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T12:40:56.078495Z"},"links":{"cited_paper":"/paper/2605.13139","citing_paper":"/paper/2605.28424"},"observation_digest":"sha256:e8a137cdf3063e5806c2117fa6fcd25433e3019aa7b08066e5f1af112c377ce5","observation_id":"bae87c06-11ed-4748-b529-1eff90569c4b","resolution":{"observed_at":"2026-06-29T12:43:25.369715Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13139","snapshot_observed_at":"2026-08-07T00:14:40.967694Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02685","last_updated":"2026-08-03T07:24:33Z","snapshot_observed_at":"2026-08-14T23:19:01.559553Z","submitted_at":"2026-08-03T07:24:33Z","title":"BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:40.967694Z"},"links":{"cited_paper":"/paper/2605.13139","citing_paper":"/paper/2608.02685"},"observation_digest":"sha256:0b6b5bf2b48bd74239bbf6bcd0b60486a4344832cf2485b0c1b96ce3c7461f20","observation_id":"cf6b6e19-dd65-4858-a242-e2e422860398","resolution":{"observed_at":"2026-08-07T00:14:40.967694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.13139/citation-record","integrity":"/paper/2605.13139/integrity","json":"/paper/2605.13139/citation-record.json","paper":"/paper/2605.13139"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 4.6 sonnet system card","venue":null,"work_id":"85bdec73-f606-453f-ac9a-34ba951a6b05","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:fb1e3ccf5e96b7a893807db56a5459cf0eb94d79892187a4f408f9b8f2b1dbc6","observation_id":"8f39a84c-823f-4f0d-97b8-9ca1cf76a4d2","resolution":{"observed_at":"2026-05-15T23:01:49.914350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9dc8b2b7-21b7-4e27-ac6c-d6ac7d3ec38f","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:32ee9d55177822758acf95e445e0b5971dc0aa3e65b220b6e085e3cd35ae8dc5","observation_id":"24dc2c11-d7c6-4521-b9d6-e106024ab202","resolution":{"observed_at":"2026-05-15T23:01:49.956856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude code","venue":null,"work_id":"a974e0ed-b8d8-4534-a3aa-34731e913fbf","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:779fe21d29bfda666cd779543ebc4ed2e48e76030468e1913f461ab7b9ae6f2e","observation_id":"d4c5bfbc-d48b-4138-abca-e5e90f2810c6","resolution":{"observed_at":"2026-05-15T23:01:49.941349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing claude opus 4.5","venue":null,"work_id":"135f65e0-92b8-43bb-8f8e-a7cd633b7005","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:e5ce9e32b6352ebf68cc69df64f5f9e20431832c453f77842524f4666cea5a03","observation_id":"b112b683-aeeb-446e-b940-6b102c5ce529","resolution":{"observed_at":"2026-05-15T23:01:49.975076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13657","last_updated":"2025-10-26T23:25:18Z","snapshot_observed_at":"2026-08-16T06:37:17.259416Z","submitted_at":"2025-03-17T19:04:38Z","title":"Why Do Multi-Agent LLM Systems Fail?","version":3},"cited_work":{"arxiv_id":"2503.13657","doi":"10.48550/arxiv.2503.13657","metadata_source":"pith","pith_arxiv_id":"2503.13657","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why Do Multi-Agent LLM Systems Fail?","venue":"cs.AI","work_id":"b186294a-cda7-4df0-9a28-27d379af92b2","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2503.13657","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:28f6b730948ad79c7d5963ed776f206e5b1ea0989d56e61c3f0b4f5e973d6ad3","observation_id":"0acde9b6-8974-44b9-87c6-d7fdf97d1b18","resolution":{"observed_at":"2026-05-14T18:37:35.740135Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jimenez, John Yang, Kevin Liu, and Aleksander Madry","venue":null,"work_id":"2631f770-df37-4397-ab24-8a3cd91580b6","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:d3a8e209f0a3d66c6a719697bcab43aafa9a4b3246dd9533300b8cb2d8d2e00e","observation_id":"b5a57f9d-55e2-4252-aef0-dbe1af71b807","resolution":{"observed_at":"2026-05-15T23:01:49.901436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-v3.2: Pushing the frontier of open large language models","venue":null,"work_id":"677e125a-e75e-4f84-bf7b-8d045b046e21","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:693468e700f4b8699bc35dca26d55cb82632d064614165d9e8c1d3f745efee91","observation_id":"2e170f2c-23a6-495d-afa8-27eae894a2fa","resolution":{"observed_at":"2026-05-15T23:01:50.031137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-08-17T01:58:07.850738Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:1e026a758d61afc456672666892fcffcb05f6832cfe3d0efe04ac170a4f4cfaa","observation_id":"800defb5-7cfc-4cd9-8999-d1d5a271988f","resolution":{"observed_at":"2026-05-14T18:37:35.728961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":"2509.16941","doi":"10.48550/arxiv.2509.16941","metadata_source":"pith","pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","venue":"cs.SE","work_id":"a561c78a-4b02-4053-a92a-bc5c7c5f6b9b","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:3242c600b9c4b21abc340a1caf53a21594e78cc9149f5d1837857ade566f2d17","observation_id":"06d7c0a3-9c97-4644-b93b-5a6fc3091519","resolution":{"observed_at":"2026-05-14T18:37:35.647810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:48.977196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:48.977196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.12730","doi":"10.48550/arxiv.2512.12730","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nl2repo-bench: Towards long-horizon repository generation evaluation of coding agents.CoRR, abs/2512.12730","venue":"ArXiv.org","work_id":"0ea67a78-d9a4-4898-ab97-00d13ebca55f","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:3f32283066fb7d504ace9a2713b3623ea009c81051f3fc00ed0d65a71073a158","observation_id":"7cf8b928-d7a6-4caa-b8b8-61f34119c575","resolution":{"observed_at":"2026-05-14T18:37:35.654299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14443","last_updated":"2025-03-18T17:19:12Z","snapshot_observed_at":"2026-08-16T12:48:54.350435Z","submitted_at":"2025-03-18T17:19:12Z","title":"EnvBench: A Benchmark for Automated Environment Setup","version":1},"cited_work":{"arxiv_id":"2503.14443","doi":"10.48550/arxiv.2503.14443","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14443","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Envbench: A benchmark for automated environment setup","venue":"arXiv (Cornell University)","work_id":"d76b3e0a-08bc-49db-bd44-f7772ec39f90","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2503.14443","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:3842210f1da269984a61519ead7288d1e6cd8b092984d7ccf1e21ea955096964","observation_id":"10ea27d6-ad3c-420d-9d3d-96a718860108","resolution":{"observed_at":"2026-05-14T18:37:35.670953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatically benchmarking llm code agents through agent-driven annotation and evaluation","venue":null,"work_id":"c1a8a8cf-983e-4ae9-ba56-a20fe389faac","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:4a08adee18deceaf83a092b9dc59c0f47f29f85b88170090825aad4954264af5","observation_id":"b4512bb2-5f9b-4206-af4a-d2ac7f29c606","resolution":{"observed_at":"2026-05-15T23:01:50.006590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:062335a325620d30990af0fecaba835eae85e8b44549d5955505c0ed87ac593d","observation_id":"bbee0fd7-96dd-494f-b598-28c093a64afa","resolution":{"observed_at":"2026-05-14T18:37:35.734348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11895","last_updated":"2026-05-16T19:19:54Z","snapshot_observed_at":"2026-08-16T20:30:48.455384Z","submitted_at":"2026-01-17T03:33:08Z","title":"DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models","version":3},"cited_work":{"arxiv_id":"2601.11895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11895","snapshot_observed_at":"2026-06-28T18:02:27.204106Z","title":"DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models","venue":"cs.LG","work_id":"392e25e9-225d-4f73-b94a-cb0664063320","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2601.11895","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:4099351745130e8ebd297f783a507acd4a284df99cda9d61a401b78de3453ff4","observation_id":"99f5f7dd-57c9-4fa6-9301-3d8edef72cc7","resolution":{"observed_at":"2026-05-20T00:03:02.290016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SWE-bench goes live!","venue":null,"work_id":"1369b70b-2539-4c1b-bd56-c8ee266c2035","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:bd5f5db130390aff20121ff612c7bf141c4e6b365cdba4117fc3d5fb8424192f","observation_id":"3bd95873-df6a-48ce-af0d-da02a47e4d69","resolution":{"observed_at":"2026-05-15T23:01:49.947884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23419","last_updated":"2025-06-01T14:53:40Z","snapshot_observed_at":"2026-08-13T20:53:50.980276Z","submitted_at":"2025-05-29T13:09:44Z","title":"SWE-bench Goes Live!","version":2},"cited_work":{"arxiv_id":"2505.23419","doi":"10.48550/arxiv.2505.23419","metadata_source":"pith","pith_arxiv_id":"2505.23419","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-bench goes live!","venue":"cs.SE","work_id":"648e52f0-7b78-4b75-8b1d-e89c9ba63afe","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2505.23419","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:4521f9cfbf7fe727638830116b2bbc7faee9e5bfeac5a38826690827c64c68e2","observation_id":"168dcc66-f3f1-450c-96b1-19f8d2b24351","resolution":{"observed_at":"2026-05-14T18:37:35.642255Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on LLM-as-a-judge","venue":null,"work_id":"a27288c0-1f79-4219-8d1c-08b986b5d933","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:3e5a17f9722b23b553753152715ba5d19f5c6777ccd71c8545f67adc16f56a2d","observation_id":"c9d67d3c-c3f4-4c6b-a413-dd94be48cfef","resolution":{"observed_at":"2026-05-15T23:01:49.971230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":"2411.15594","doi":"10.1016/j.xinn.2025.101253","metadata_source":"pith","pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on LLM-as-a-Judge","venue":"cs.CL","work_id":"2676656a-67bd-4ad5-bad6-cb6f5fcdbfbe","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:7d9ba32ca6745dca8e4168e7ea21644085d05bf27c18e77d04b2753be149fd13","observation_id":"05c195a7-ecff-4b7f-8051-da32307a8de2","resolution":{"observed_at":"2026-05-14T18:37:35.694334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:0ae6be14cbc910c94521b6f34fe8dc500c394e4c5d301169b08a0f1862129268","observation_id":"47d985c1-63ae-4e6d-b40d-da0006c859d3","resolution":{"observed_at":"2026-05-14T18:37:35.625161Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kimi k2.5: Scaling reinforcement learning with llms","venue":null,"work_id":"fede601b-ba92-48d8-a2d6-ad386a2ba909","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:a16b0d632f4d52bb76588b8218945e4e2fa5621347ccf71b0ca71f218831064f","observation_id":"c9b2f28a-9075-49ca-8c91-aeaf68a706ca","resolution":{"observed_at":"2026-05-15T23:01:49.952440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fea-bench: A benchmark for evaluating repository-level code generation for feature implementation","venue":null,"work_id":"29adb8ec-98d6-49f0-a23b-bbfaa0878e2d","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:6611d1df7f5917b65d0b6463529ce8381d871f793f911cb18a1b025e341f7e20","observation_id":"157a6330-e45b-45ea-98d1-cb016d0ca2ae","resolution":{"observed_at":"2026-05-15T23:01:50.027105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.12286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:07:19.641893Z","title":"The swe-bench illusion: When state-of-the-art llms remember instead of reason","venue":null,"work_id":"d26dd136-7889-4ef2-a5f0-285608e2ca30","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:589f010940c0c6b6759b7fc2825647368fdfdced78a64a0f2953c5a1c49062cb","observation_id":"b741897f-c688-422f-9069-1a37b35a06b5","resolution":{"observed_at":"2026-05-14T18:37:35.677223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10535","last_updated":"2025-08-14T17:58:50Z","snapshot_observed_at":"2026-08-15T03:05:26.568876Z","submitted_at":"2025-07-14T17:56:29Z","title":"CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks","version":2},"cited_work":{"arxiv_id":"2507.10535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10535","snapshot_observed_at":"2026-07-07T12:53:50.345403Z","title":"CodeJudgeBench: Benchmarking LLM-as-a-judge for coding tasks","venue":"cs.CL","work_id":"7e37bba3-99fb-4b09-af65-f199ccc4101e","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2507.10535","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:72c50a03124f65ed19903b08cb7e1f72880eb30dffb43d7b469ce3b3609763d7","observation_id":"7e8a0566-9712-4552-86ea-45b3bb2a9231","resolution":{"observed_at":"2026-05-14T18:37:35.746653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.11867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T15:17:07.515044Z","title":"AI-augmented CI/CD pipelines: From code commit to production with autonomous decisions","venue":null,"work_id":"6c4083a4-4662-49d0-96ed-52f0d64f2819","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:3e80b3a7569efa0ac269a4ad3b35ce0daeb2644aba483772b61b824fa7f3f83f","observation_id":"ae762665-5c15-4411-bc08-83ddb720f0e9","resolution":{"observed_at":"2026-05-14T18:37:35.665526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minimax 2.7","venue":null,"work_id":"f26600bc-1b20-4714-896e-32ae891fec59","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:7a8fe77cb9ab35d45376511dc50b4f7b0c595283221e70e49743cc114723c4aa","observation_id":"820c68bf-b14e-4bd3-b6fa-6490f60cf458","resolution":{"observed_at":"2026-05-15T23:01:50.014101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing codex","venue":null,"work_id":"c06b02e7-f3be-4f0b-813a-e63f05db72c9","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:c85111b451f30095a08a3df958e34a8941b963da9ff61501d940c68222103464","observation_id":"f8d488e6-da18-4a01-ba1b-89bf51a58f7c","resolution":{"observed_at":"2026-05-15T23:01:49.967009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gpt -5.4","venue":null,"work_id":"c5849d99-c47a-46c0-bdc9-8423bef1d04a","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:5a7a54824a034a75812a237a24c9d4836ca972d37ccae752d96346c6a8c499fb","observation_id":"757583f8-c768-4c7b-be1e-6a23621e5d77","resolution":{"observed_at":"2026-05-15T23:01:49.928700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why swe-bench verified no longer measures frontier coding capabilities","venue":null,"work_id":"44e21fe3-a948-4630-a4a5-7fb8b8078b42","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:cc4befb19d7806a713608236eddc33d2f178022ce7686ebd275d5b945fce05ae","observation_id":"47a95b06-f6c5-4221-af19-5526b3f1b2d5","resolution":{"observed_at":"2026-05-15T23:01:50.018434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opencode","venue":null,"work_id":"839d0c32-d026-467d-bdd7-af8d89ea1d2e","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:adce1b4339afdf55c9b79ef1ef098e12603ae4afed6f86646702ba3199bcd96a","observation_id":"57532272-9dff-447d-918a-81a595b91fae","resolution":{"observed_at":"2026-05-15T23:01:49.892926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3.5: Towards native multimodal agents","venue":null,"work_id":"1b58eeb8-86a7-4531-ad00-1fc91203f19a","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:1ed6a2cbe1dc503e9a1a0c16c0be120f17b3a604af1b73f63e40e605699d555f","observation_id":"79aebd07-797c-4c7f-b08c-255fb7710ef5","resolution":{"observed_at":"2026-05-15T23:01:49.910330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judging the judges: A systematic study of position bias in LLM-as-a-judge","venue":null,"work_id":"a33deac8-8ab7-4c58-8439-ae183ee55503","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:ee4b1460d6e40ddd3c36c9c6421d66930aee21aaa925b64078239e0b36da62a5","observation_id":"8105ea53-4ae9-4099-8061-a08b4bdaf9c5","resolution":{"observed_at":"2026-05-15T23:01:49.984096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.07791","doi":"10.48550/arxiv.2406.07791","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging the judges: A systematic study of position bias in llm-as-a-judge","venue":"arXiv (Cornell University)","work_id":"11308458-d080-4667-b088-70cc9c815627","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:74127f74d2eb9013ec12fe4cf021d2a8d0f2f046dea95fe8b7c9d7222967e8aa","observation_id":"87a6cf65-e1a2-495b-b7c0-201cf7c4f6f6","resolution":{"observed_at":"2026-05-14T18:37:35.689428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04531","last_updated":"2025-02-01T08:28:28Z","snapshot_observed_at":"2026-08-16T13:45:20.623404Z","submitted_at":"2024-06-06T22:07:50Z","title":"TESTEVAL: Benchmarking Large Language Models for Test Case Generation","version":2},"cited_work":{"arxiv_id":"2406.04531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04531","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Testeval: Benchmarking large language models for test case generation","venue":null,"work_id":"7c48f804-10b9-4ff7-be40-771b4a27d54e","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2406.04531","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:79653903f16bd7bf77d4a631c0ffe11d2380a7e2057bc104f15070a2fcc64ad0","observation_id":"186f474c-93d4-4942-af0e-5c2d5ddf9276","resolution":{"observed_at":"2026-05-14T18:37:35.700926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-14T17:59:52.524740Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":"2407.16741","doi":"10.1145/3718958.3750537","metadata_source":"pith","pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","venue":"cs.SE","work_id":"f1762ea0-e382-4f38-a28c-adc643789859","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:e79e903b6568b528191190de4b68c4950cc0ea570fe636603944d240204950c8","observation_id":"ffbef9ce-f7a9-451c-95f4-794e77d3bc1a","resolution":{"observed_at":"2026-05-14T18:37:35.682928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.05459","doi":"10.48550/arxiv.2511.05459","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-compass: Towards unified evaluation of agentic coding abilities for large language models","venue":"ArXiv.org","work_id":"d066d198-9f17-456c-b54f-1e021e2491d4","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:6e73dd6a272074d5683253c4a43247c4de50ab7a0bcfa431fd59839595daa92a","observation_id":"cd10b8d8-8ccd-4133-a331-affe3082a46f","resolution":{"observed_at":"2026-05-14T18:37:35.718131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:50.256143+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:50.256143+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":"2405.15793","doi":"10.48550/arxiv.2405.15793","metadata_source":"pith","pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","venue":"cs.SE","work_id":"01826cd9-a652-403c-a2ec-531da9fe2b6a","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:ae8bdf0f3f5e072a7ab07487f5c9c6436bc83567018d0055dc283bb8c3d6500b","observation_id":"ba7c243e-a464-4d83-9c98-5bd5bb1aca93","resolution":{"observed_at":"2026-05-14T18:37:35.723441Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:24.962823+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:24.962823+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21798","last_updated":"2025-05-21T17:21:45Z","snapshot_observed_at":"2026-08-11T02:21:44.551484Z","submitted_at":"2025-04-30T16:56:06Z","title":"SWE-smith: Scaling Data for Software Engineering Agents","version":2},"cited_work":{"arxiv_id":"2504.21798","doi":"10.48550/arxiv.2504.21798","metadata_source":"pith","pith_arxiv_id":"2504.21798","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-smith: Scaling Data for Software Engineering Agents","venue":"cs.SE","work_id":"6a906763-2e4e-4cea-a19c-d7a169c9376b","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2504.21798","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:9c4b4ffb5f18beadced0ae05a2101d6f0046cf54f9067d3086bffff66898c24d","observation_id":"6dc1be81-c762-4733-9820-836d59fdf508","resolution":{"observed_at":"2026-05-15T10:22:07.061654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:46:28.203038Z","title":"A survey on agent-as-a-judge","venue":null,"work_id":"87fad81b-b92e-4cdd-8ed9-4b3eab319533","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:e66896f27c8f2520fbc17e96d60efc89f3136157ca376ba5b9ea349cbe1d025e","observation_id":"9bf6cb5b-05b5-465a-a0a9-35aead4d7647","resolution":{"observed_at":"2026-05-14T18:37:35.636641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09289","last_updated":"2025-06-10T22:56:49Z","snapshot_observed_at":"2026-08-15T16:17:39.330894Z","submitted_at":"2025-06-10T22:56:49Z","title":"UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench","version":1},"cited_work":{"arxiv_id":"2506.09289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09289","snapshot_observed_at":"2026-07-09T00:45:49.165798Z","title":"Utboost: Rigorous evaluation of coding agents on swe-bench","venue":"cs.SE","work_id":"9a32973a-42d7-45be-b7f4-1c8f16defec1","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2506.09289","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:b598ea962b1b99e185453fa1e70918cfcca76b55c1b89d7195a70542f47212cd","observation_id":"e8bffac2-2362-405e-979e-0d80bf9124d8","resolution":{"observed_at":"2026-05-14T18:37:35.712422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02605","last_updated":"2025-04-03T14:06:17Z","snapshot_observed_at":"2026-08-09T23:51:45.534260Z","submitted_at":"2025-04-03T14:06:17Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving","version":1},"cited_work":{"arxiv_id":"2504.02605","doi":"10.48550/arxiv.2504.02605","metadata_source":"pith","pith_arxiv_id":"2504.02605","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving","venue":"cs.SE","work_id":"c66ce635-0931-4807-8300-a45863330d75","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2504.02605","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:e7fc091c6f1a7e150c18fb247c5eb71cfc578a7c287929f73fc19855193cdca6","observation_id":"5d79af07-b491-413c-9565-b0ca16be89d0","resolution":{"observed_at":"2026-05-16T06:48:50.578231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.442994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.442994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.04064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking and studying the LLM-based agent system in end-to-end software development","venue":null,"work_id":"dc25761d-fffa-46f4-abf5-626b1e80b59b","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:31070cbb4de4f8b45c5b30c053fc59efb3ba74069012a205f8f3c527ad661695","observation_id":"58b34f3b-6e84-46fa-8d8f-b4ba0606b841","resolution":{"observed_at":"2026-05-14T18:37:35.706846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.23448","last_updated":"2026-04-07T08:07:13Z","snapshot_observed_at":"2026-08-13T00:21:02.193494Z","submitted_at":"2026-03-24T17:19:32Z","title":"Code Review Agent Benchmark","version":3},"cited_work":{"arxiv_id":"2603.23448","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.23448","snapshot_observed_at":"2026-07-01T23:46:24.195113Z","title":"Code Review Agent Benchmark","venue":"cs.SE","work_id":"7b56d65d-90c8-4222-b267-b8e4ca8eacf7","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2603.23448","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:6d3aec61052e79f41874a0fa6e3b453def59aec61b43f2878d6fe9a4ff2b4d1c","observation_id":"4137c77f-1907-4dab-a990-90f6801c62e1","resolution":{"observed_at":"2026-05-14T18:37:35.601499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:f890330ba417a48cac8152762ec20b19c9ba7c94f3c1de10885d6bd38b1d7d37","observation_id":"ed42a165-78bc-424e-87dd-a1eb4ae84664","resolution":{"observed_at":"2026-05-14T18:37:35.595562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10975","doi":"10.48550/arxiv.2602.10975","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Featurebench: Benchmarking agentic coding for complex feature development","venue":"Open MIND","work_id":"b018156c-79c6-4598-ab07-bbbd49818525","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:b71658f7002aa0535ec77f19b5ef0a11425e17a8930b4026b0d8f8fc66a27765","observation_id":"d9834f42-147b-4b28-8578-ef0bb7705754","resolution":{"observed_at":"2026-05-14T18:37:35.606935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-15T11:03:19.944695Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"cited_work":{"arxiv_id":"2507.02825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02825","snapshot_observed_at":"2026-07-03T22:08:59.930877Z","title":"Establishing best practices for building rigorous agentic benchmarks","venue":null,"work_id":"981c0760-99e5-4175-bca8-6be3ed159f5b","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2507.02825","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:b7f9f21278201ca5431c5feff1a7621f779317bb20972f55bceade068ba66d6f","observation_id":"439b1478-b2b6-49fe-b683-513b6b3c67d9","resolution":{"observed_at":"2026-05-14T18:37:35.612990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10934","last_updated":"2024-10-16T17:54:12Z","snapshot_observed_at":"2026-08-16T13:09:29.535530Z","submitted_at":"2024-10-14T17:57:02Z","title":"Agent-as-a-Judge: Evaluate Agents with Agents","version":2},"cited_work":{"arxiv_id":"2410.10934","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10934","snapshot_observed_at":"2026-07-10T15:07:19.644728Z","title":"arXiv preprint 2410.10934","venue":"cs.AI","work_id":"2e127924-0ccf-418b-9de5-0daa4fb9ad9b","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2410.10934","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:569e932c823dd3c9d9bef0901d5e0a8c8d29c89cd63225968ac5b19aaeb61f81","observation_id":"25d3278a-d921-4036-8ea9-7e4ab95b21e4","resolution":{"observed_at":"2026-05-14T18:37:35.630963Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6007bda5-a8dc-41c0-8863-1c3c9e068d4b","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:4e54a6dea9314c7d2d680649a9ad2afaea7ee7cbe1e2c98d5634ceb3f2a0b316","observation_id":"8d69d62f-7e95-4fb1-ab4e-023371b1f24b","resolution":{"observed_at":"2026-05-15T23:01:50.043851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4a28afb8-73d8-456f-8625-511c40d5f828","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:1db38531cd1521740fd26562562ba588728eec7e77a7cf8e8c000f3f57b043f3","observation_id":"2e21bd4a-f7af-4c30-bba1-7b2bfbca1dcc","resolution":{"observed_at":"2026-05-15T23:01:50.010212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dad75306-4153-4ba2-8e03-0ba06e52ea28","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:b1e1e50ed3df0541439c4f229661002d34f514a567a42e126bb5774a34d652f4","observation_id":"1d57bd5b-70e3-4bbd-bac1-4f537dedcefc","resolution":{"observed_at":"2026-05-15T23:01:50.022529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"90e132e2-227e-4062-a00d-d9aa1f8bd637","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:79707418ae3b964fff32e5b1d113ec44c5701c91d0f5f0cb6d49d5f235744eef","observation_id":"b120c0a3-ec14-47c2-9d62-564cb9377c83","resolution":{"observed_at":"2026-05-15T23:01:50.035401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"980f4c14-b594-4f8e-ac04-7cfb8ad2693f","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:62a7c4b21f1bc5594d1b7e2cb3d922a4c0f1cff8c85e2d6362730ff559bfbec5","observation_id":"01a4390e-1089-4a6e-9157-30213b2708e1","resolution":{"observed_at":"2026-05-15T23:01:50.002326Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Couldn’t find the node_modules state file","venue":null,"work_id":"eb200b34-5fcd-4599-a956-5b05395fb5e9","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:40f6e6484c60fd4635141b5274a5423ca70ae4cb40e66d23eb12d551c68afb30","observation_id":"bfeed184-1892-446e-8941-50f8d41799ec","resolution":{"observed_at":"2026-05-15T23:01:49.919142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aa1ca75e-03a9-43b5-af55-51784cc17d51","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:58fe51541a76517112f18e8b5017dcaf671c4097ac39b193c2dc5e39af0decaf","observation_id":"30114309-4de2-44d2-ac52-6bec5cca32d4","resolution":{"observed_at":"2026-05-15T23:01:49.988243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a898064c-cb2a-4da4-821d-9c0ac22b0aab","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:9bab8c2f391470be027e410298b815d3bb5bf05579d612f53564d201f8e1c768","observation_id":"769648b1-d8f0-4bf2-b349-6c597f4914c7","resolution":{"observed_at":"2026-05-15T23:01:49.905830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic: Node.js v18.20.8 available, packages import successfully, 359 tests collected","venue":null,"work_id":"2ef58fdf-e071-4761-baee-6198f467a324","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:dfc1ec652a572db0de1b8bec73c342d4f2bbc82aa4f4937c1a14f4b5a10304af","observation_id":"f338d8c3-2562-4565-a009-be497e945760","resolution":{"observed_at":"2026-05-15T23:01:49.923955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic: Phase 1 fails with TypeError: User.getLocalCoverPath is not a function (imprecise failure)","venue":null,"work_id":"3408be9c-1d4d-418f-b9e5-95861207befd","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:d194cac0a86765c44fe841aa354274d375d3ae816656fb97768758afe80846ce","observation_id":"ab444dc9-7c4d-4cf9-a427-284fbd7287df","resolution":{"observed_at":"2026-05-15T23:01:49.897115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f680e9c0-7b1f-4bdf-875c-ef0b39641cf5","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:cf4b5af8d0219610ed79eeb24dc8a4f4c6d15192281a80fbaeb4dafc58e54250","observation_id":"8aed5eff-be21-45ab-b9e6-3af4fa0013d5","resolution":{"observed_at":"2026-05-15T23:01:49.883785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score: 2/4","venue":null,"work_id":"9e93ee54-5c8b-415e-8f7e-0ef0e5be69db","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:b88ab20ef47a0ea8733d3175da05459c67bf3523f314f4d4dc210ea09b894d77","observation_id":"1506d4e0-abd3-417f-91c2-95a62a1c3083","resolution":{"observed_at":"2026-05-15T23:01:49.888657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The agent correctly implements both required changes: adding -Dsolr.max.booleanClauses=30000 to SOLR_OPTSand definingFILTER_BOOK_LIMIT = 30_000","venue":null,"work_id":"ee9f3abb-c237-4374-9070-3f0ad4c2098b","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:b46792273c8cf7961ad3da2e8ccbe5764143f4f7a794ddb34a721caf9034e9a6","observation_id":"d5894d27-5935-435f-a6f7-38e2f3d532ad","resolution":{"observed_at":"2026-05-15T23:01:49.979350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Both tests pass: test_filter_book_limit_constant_exists and test_solr_opts_has_boolean_clauses_limit","venue":null,"work_id":"78209386-ae23-4aca-9c6c-580bfda7812d","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:c19548c0348f94ec6d1edf16871753a8589506f3c5cb59486858bf82bcd94215","observation_id":"69bbb8a5-8322-48fc-9519-5a3d666f09a6","resolution":{"observed_at":"2026-05-15T23:01:49.937280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SWE-Judge confirms the agent’s tests are not trivial or overfitted: they verify specific code content rather than relying on indirect signals","venue":null,"work_id":"f038fe73-3c82-4964-a5e9-76e4c5d3ed7a","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:638eea231935ffd9f348e9b8fbc2fa1c2c008b3ad7526bdccab9fd1db31f8c62","observation_id":"15fd44fd-657f-4a83-9e13-cfb5c271921a","resolution":{"observed_at":"2026-05-15T23:01:49.997690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic: Python 3.11.1 available, but core package import fails (ModuleNotFoundError: web)","venue":null,"work_id":"9c522878-50e2-4272-94c7-c99748785440","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:139105520310df19ea69c6704cf17f79d7e9ffeebaafa093a09c3e018e3b3109","observation_id":"0e0feb14-e7c4-48c9-be4e-2a496622fdad","resolution":{"observed_at":"2026-05-15T23:01:49.992963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6b5d5a92-94a9-4ff6-9d09-b9717c0c8d83","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:8b659f210dfa92ec130b7b41adfd088b1b11b27cc720a5527fc25727e04813ba","observation_id":"e83ddd70-1853-42e4-8426-01e8921b2968","resolution":{"observed_at":"2026-05-15T23:01:49.961018Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The agent’s implementation aligns closely with the golden patch, using cleaner error handling patterns in some cases","venue":null,"work_id":"4216faed-713b-4e3b-ae88-e4f2a4db02aa","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:0afc024fd3145d42e76451e844464b0b4c0d082e33b647faa4f96440df6a2ba6","observation_id":"e389089a-a207-4b09-8069-47139314dddf","resolution":{"observed_at":"2026-05-15T23:01:49.933040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"to confirm compilation succeeds, then uses a non-matching test pattern to verify test collection without execution","venue":null,"work_id":"0f422c5a-b0fc-484e-a8aa-2724597fa2c9","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:c0e144f14b16eaee617e7ee3074ecb38b28cb84c4f86b4e16dfda865b3275f89","observation_id":"86b61698-9222-47dc-9084-83d69b810310","resolution":{"observed_at":"2026-05-15T23:01:50.039513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implementation is functionally identical to gold.patch—correctly implementsescapeseqfilter with equivalent logic","venue":null,"work_id":"e1c8f457-cc3d-4829-87d0-a13ab466bd7c","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:35c13d30500b1995452b8ff9a3d60e08c57f73333756d25d2d5c18bf24a5e6fa","observation_id":"711dc2ad-1865-4a14-98d0-c69ea1dfcf20","resolution":{"observed_at":"2026-05-15T23:01:49.879449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-14T08:57:47.657620Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":10,"verified_exact":22,"verified_fuzzy":28},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2605.13139."}