{"as_of":"2026-08-10T03:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e3aa8204f598a511d0cd4e052905f2211488f9050ac8676595aec1cbf4267bd","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:57:13.152676Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06980/citation-record","integrity":"/paper/2507.06980/integrity","json":"/paper/2507.06980/citation-record.json","paper":"/paper/2507.06980"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.931054Z","title":"https://deepmind","venue":null,"work_id":"19468a04-5de5-459f-9af3-2d40e8b63f1b","year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:12.986869Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:0f34101c6572144eeed13a39a372634986a422bf9493695fc25a9455e7783014","observation_id":"fd190d38-f3f5-40f7-9983-5ec715a5a2e7","resolution":{"observed_at":"2026-08-06T18:57:13.934083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.922021Z","title":"https://platform.openai.com/docs/models/o1/","venue":null,"work_id":"05416c29-0003-40e5-b584-54671aed18f0","year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:12.990649Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:2234868be6e62aa2dd01feb947cfeffd828716768d1ed2af40f65f052f089de7","observation_id":"e420d59f-78dc-4941-9f59-94a7e5a1999c","resolution":{"observed_at":"2026-08-06T18:57:13.925186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.913459Z","title":"Let the llms talk: Simu- lating human-to-human conversational qa via zero-shot llm-to-llm interactions","venue":null,"work_id":"0a651e36-3646-47cd-af13-3880960f4572","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:12.994078Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:3baea8c07a3d3e7385b1ae077175805f63a227e8b131dabc764870c8cccbd145","observation_id":"0dd13243-0a6e-4ccb-b74b-5f82f94bdd86","resolution":{"observed_at":"2026-08-06T18:57:13.916708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-07T17:12:11.913580Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-06T18:57:12.997242Z","title":"Chain-of-thought reasoning in the wild is not always faithful","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:12.997242Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:d426105ecf8d8a70e9b48ad5d91995d4781cca611405005f02613ba46c565949","observation_id":"dddb8680-2d31-4975-acb9-d35b4364e831","resolution":{"observed_at":"2026-08-06T18:57:12.997242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.904720Z","title":"Is github’s copilot as bad as humans at introducing vulnerabilities in code? Empirical Software Engineering , 28(6):129, 2023","venue":null,"work_id":"f5099085-ed9f-453b-ac25-3353a0a5d365","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.000811Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:0019c915e1652008e158723b58cc9c399b859cc2c890251e79691ba6c9c16671","observation_id":"090910c8-f8c0-45e2-b788-b55841329f11","resolution":{"observed_at":"2026-08-06T18:57:13.908021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T18:57:13.003900Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.003900Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:ccf6bf0d52dd8c14ea283e24cf32e8e27532361607fb118d9f2d0dcbc8c2ca9f","observation_id":"05f384a1-10a6-4683-be98-6259d406079d","resolution":{"observed_at":"2026-08-06T18:57:13.003900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10397","last_updated":"2022-11-23T07:42:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-21T10:18:37Z","title":"CodeT: Code Generation with Generated Tests","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10397","snapshot_observed_at":"2026-08-06T18:57:13.007465Z","title":"Codet: Code generation with generated tests","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.007465Z"},"links":{"cited_paper":"/paper/2207.10397","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:5dbf4ba05596b541e3b11c8fdbe18ee4003e121077c934546d56ed0879469263","observation_id":"045be678-fa73-44e7-a757-e3b6f3933bdc","resolution":{"observed_at":"2026-08-06T18:57:13.007465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T18:57:13.010764Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.010764Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:76f59b926886b235a71ec5451f8e436d49291aa0b3c99d9801fa962a3bc69ba3","observation_id":"148742a7-2c10-4e69-8977-1e0c1515a2ed","resolution":{"observed_at":"2026-08-06T18:57:13.010764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09089","last_updated":"2025-04-29T14:37:43Z","snapshot_observed_at":"2026-08-07T17:11:01.393818Z","submitted_at":"2025-03-12T05:55:01Z","title":"LocAgent: Graph-Guided LLM Agents for Code Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09089","snapshot_observed_at":"2026-08-06T18:57:13.014157Z","title":"Locagent: Graph- guided llm agents for code localization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.014157Z"},"links":{"cited_paper":"/paper/2503.09089","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:52f88a1705e112cd301799e16696b9164869a98604a7f2f7dcb1d1532623507b","observation_id":"225d0a00-59af-4c61-91b4-d43e484106a3","resolution":{"observed_at":"2026-08-06T18:57:13.014157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03095","last_updated":"2025-03-31T13:13:27Z","snapshot_observed_at":"2026-07-06T18:57:22.433852Z","submitted_at":"2024-08-06T10:52:41Z","title":"TestART: Improving LLM-based Unit Testing via Co-evolution of Automated Generation and Repair Iteration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03095","snapshot_observed_at":"2026-08-06T18:57:13.017270Z","title":"Testart: Improving llm-based unit test via co-evolution of automated generation and repair iteration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.017270Z"},"links":{"cited_paper":"/paper/2408.03095","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:f61fc1478a66a880297bad723595a2df9e174dcf2afe26702747d6bfc18424d8","observation_id":"80cf230c-d9ba-41d1-90f5-b62e0adc921f","resolution":{"observed_at":"2026-08-06T18:57:13.017270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:57:13.020754Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.020754Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:1e63a7f0d809b925fe93382b43edb1ddae7afc40185088d4f16c182c45d6de5d","observation_id":"32968c5c-115a-42f3-b597-5eced2799e7b","resolution":{"observed_at":"2026-08-06T18:57:13.020754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-06T18:57:13.023840Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.023840Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:aba181ccbd39d8f778f2fb2380597d90c5e2602d6ba7c98f3123a1c04987a4b0","observation_id":"9e300668-1bd3-483e-8cd5-14f4e1a3a8cf","resolution":{"observed_at":"2026-08-06T18:57:13.023840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08784","last_updated":"2024-02-23T04:56:37Z","snapshot_observed_at":"2026-08-04T06:36:18.617860Z","submitted_at":"2023-08-17T04:58:51Z","title":"CodeCoT: Tackling Code Syntax Errors in CoT Reasoning for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08784","snapshot_observed_at":"2026-08-06T18:57:13.026859Z","title":"Codecot: Tackling code syntax errors in cot reason- ing for code generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.026859Z"},"links":{"cited_paper":"/paper/2308.08784","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:f2957ad292aecaf87a42e711afcca735e47e91cae76bf4bcf9d64a482a281860","observation_id":"0051cb81-9ce3-476a-8660-fb9c4255a904","resolution":{"observed_at":"2026-08-06T18:57:13.026859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.896012Z","title":"Adaptive mixtures of local experts","venue":null,"work_id":"aa1e643e-35c9-4a1c-aff2-24021744cdb8","year":1991},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.029804Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:4120d09ce226fbf5dad35a8fc451421204b130492a4820b5bd7060561466f20a","observation_id":"ffb95e5f-90fc-4f40-9179-e16ed179174e","resolution":{"observed_at":"2026-08-06T18:57:13.899144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.032645Z","title":"Devanbu, and Emily Morgan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.032645Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:48412a8f272d80a58d90305a2a5b00ba4b3551e8a065392cb39b926b3897180d","observation_id":"ba85e74d-42fd-45f5-948b-472c83fb2b4a","resolution":{"observed_at":"2026-08-06T18:57:13.032645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.887465Z","title":"Self- planning code generation with large language models,","venue":null,"work_id":"98e20a1c-e989-4af6-bbdd-d3e446d467b2","year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.035407Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:a48e7c7957519110ad24e167a76e1fc1d690b32d002bd9e4b8530a6d628fae70","observation_id":"9698e8eb-768d-4d64-a7ba-e16e2bd72a79","resolution":{"observed_at":"2026-08-06T18:57:13.890614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-06T18:57:13.041485Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.041485Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:d5c061d5762e366b529ea28032e163c422b87d05a550aa9b7e131ad2443de0f0","observation_id":"c72dfe49-e09c-4735-9f4c-533e027ca233","resolution":{"observed_at":"2026-08-06T18:57:13.041485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2305.14934","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.490965Z","title":"Grace: Discriminator- guided chain-of-thought reasoning","venue":null,"work_id":"836226e1-7050-4711-bf19-9e0c35e29b8e","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.044893Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:69db0719f61851cc96f51de5276d1f0b3175fd70c6b7309af60e2a286530ba75","observation_id":"d9976e03-e007-4c23-ab53-7cb684635acf","resolution":{"observed_at":"2026-08-06T18:57:13.499467Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.877605Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"6ca5fb8c-518e-4ee6-9cf6-6621c274b24a","year":2022},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.047794Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:977e135860f1d10943b739f1557120b08c48cdfad53d0ece5dc5bef84faa1a0d","observation_id":"cc63a596-dd09-4fde-9c68-dca2c4fcba1e","resolution":{"observed_at":"2026-08-06T18:57:13.881690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01780","last_updated":"2022-11-03T08:32:59Z","snapshot_observed_at":"2026-08-08T07:32:45.881885Z","submitted_at":"2022-07-05T02:42:15Z","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01780","snapshot_observed_at":"2026-08-06T18:57:13.050671Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.050671Z"},"links":{"cited_paper":"/paper/2207.01780","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:445f3b5af6016fed42f273f8ac8edf721422645472f20520f255739e5066c163","observation_id":"c3beeed5-0e39-4cf6-b8c5-fd66db7ff908","resolution":{"observed_at":"2026-08-06T18:57:13.050671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08992","last_updated":"2024-03-14T03:29:09Z","snapshot_observed_at":"2026-08-06T19:54:06.789058Z","submitted_at":"2023-10-13T10:17:48Z","title":"CodeChain: Towards Modular Code Generation Through Chain of Self-revisions with Representative Sub-modules","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08992","snapshot_observed_at":"2026-08-06T18:57:13.053921Z","title":"Codechain: Towards JOURNAL OF LATEX CLASS FILES, VOL","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.053921Z"},"links":{"cited_paper":"/paper/2310.08992","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:36d142036d891489067c9413f276d10a8ec4142991344d090606805b39d8cc83","observation_id":"65298404-a8eb-4a09-a9d3-95c87983cf7a","resolution":{"observed_at":"2026-08-06T18:57:13.053921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.869292Z","title":"Structured chain-of-thought prompting for code generation","venue":null,"work_id":"2890c64f-3a2d-47e4-88c8-c529fa1babe9","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.056940Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:d3a61e1209a187e8bd1b743eec5394d204c7200c5dedf261ebbc2655d493a1f1","observation_id":"0695e282-24b3-438e-9c2b-e81d33b5cdbe","resolution":{"observed_at":"2026-08-06T18:57:13.872380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04329","last_updated":"2024-11-12T19:37:20Z","snapshot_observed_at":"2026-08-02T04:28:22.816405Z","submitted_at":"2024-11-07T00:09:54Z","title":"CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04329","snapshot_observed_at":"2026-08-06T18:57:13.060665Z","title":"Codetree: Agent-guided tree search for code generation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.060665Z"},"links":{"cited_paper":"/paper/2411.04329","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:1a39265f00566bf9f86d8e5dcaa507c6e8563edef136881d23e97621c82b6757","observation_id":"882c4230-c241-4e77-bd71-ce8f3d35ecb4","resolution":{"observed_at":"2026-08-06T18:57:13.060665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19118","last_updated":"2024-10-09T02:41:21Z","snapshot_observed_at":"2026-08-01T16:20:31.337598Z","submitted_at":"2023-05-30T15:25:45Z","title":"Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19118","snapshot_observed_at":"2026-08-06T18:57:13.064699Z","title":"Encouraging divergent thinking in large language models through multi-agent debate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.064699Z"},"links":{"cited_paper":"/paper/2305.19118","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:4694addd7eb42421889032ae79c0a3e82f63073df57a707a577d05263527e7bf","observation_id":"19e30428-4e58-4c6d-a4bd-a0a367e5d86d","resolution":{"observed_at":"2026-08-06T18:57:13.064699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.860249Z","title":"Fastfixer: An efficient and effective approach for repair- ing programming assignments","venue":null,"work_id":"1ac82b45-5ca1-4d45-b2a7-589fa7823af9","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.068804Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:60ccbd5ec82e03cae88f05492a2be3d2e58273e2d14478f141238f281a2e6495","observation_id":"9bfbd08e-aa7c-45d3-8557-4f96bc069445","resolution":{"observed_at":"2026-08-06T18:57:13.863794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.848834Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation, 2023","venue":null,"work_id":"4cd62b22-52f8-4237-9021-3db6661cb1d1","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.071864Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:9d67dcb877198f69c574c19ec8aa06ad32c8aa8b67eb3969824792c948d1dbd1","observation_id":"6c66ca81-1f1b-49cd-8d84-7eaa522da989","resolution":{"observed_at":"2026-08-06T18:57:13.854116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.839707Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"19ff092f-013d-4175-9156-f51f170ae772","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.074817Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:66f12af87e75f284cc9ad620bdfc69c5ddbe7d553e3727c731dccf73b5ddb7be","observation_id":"8e83878d-5eec-411e-9108-24a62f1728de","resolution":{"observed_at":"2026-08-06T18:57:13.843107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.830263Z","title":"Refining chatgpt-generated code: Characterizing and mitigating code quality issues","venue":null,"work_id":"1a4df3e9-3f0d-4c10-a4dc-6582288a969e","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.077529Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:89a9788aad237f3990f17c1211ca2e61ad20065b2ac97976d2678ac1f8cd5323","observation_id":"b52eba2d-4f23-4672-88a9-095b01315893","resolution":{"observed_at":"2026-08-06T18:57:13.834059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04838","last_updated":"2024-04-13T04:58:47Z","snapshot_observed_at":"2026-07-06T16:04:18.544245Z","submitted_at":"2023-08-09T10:01:09Z","title":"No Need to Lift a Finger Anymore? Assessing the Quality of Code Generation by ChatGPT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04838","snapshot_observed_at":"2026-08-06T18:57:13.080535Z","title":"No need to lift a finger anymore? assessing the quality of code generation by chatgpt, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.080535Z"},"links":{"cited_paper":"/paper/2308.04838","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:8265ef5179ba745adba85a6cf6391b7574eedfe49aacfe9c085f70297d29a024","observation_id":"1257cabc-3675-4503-869c-657aec8b956a","resolution":{"observed_at":"2026-08-06T18:57:13.080535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10698","last_updated":"2023-10-22T10:21:12Z","snapshot_observed_at":"2026-07-06T16:34:08.044974Z","submitted_at":"2023-10-16T05:09:58Z","title":"Bridging Code Semantic and LLMs: Semantic Chain-of-Thought Prompting for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10698","snapshot_observed_at":"2026-08-06T18:57:13.083644Z","title":"Bridging code semantic and llms: Semantic chain-of- thought prompting for code generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.083644Z"},"links":{"cited_paper":"/paper/2310.10698","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:d3ec1e05ca32cb32e82b6079b79f1bdee5e7051c5f486e4a9db14862aafbd474","observation_id":"799725ee-bf4a-4800-aec3-7672cdaf2d4e","resolution":{"observed_at":"2026-08-06T18:57:13.083644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.086901Z","title":"Clarifygpt: A framework for enhancing llm-based code generation via requirements clarification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.086901Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:e6ccf5377db09417a46364e3e5348d05b68a9f4a7d20873d59e878d52bf56b15","observation_id":"625000bc-dd32-486c-9730-b64f0772c4aa","resolution":{"observed_at":"2026-08-06T18:57:13.086901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-06T18:57:13.089866Z","title":"Codegen: An open large language model for code with multi-turn program synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.089866Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:e098fb582bd08251232ae8f89b8328e1e9f581c856454067f3ed0bff9766b489","observation_id":"cdb89cb4-0d81-4e13-aba0-cd6f81df5a2b","resolution":{"observed_at":"2026-08-06T18:57:13.089866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06195","last_updated":"2024-08-12T14:42:13Z","snapshot_observed_at":"2026-08-09T16:44:49.698332Z","submitted_at":"2024-08-12T14:42:13Z","title":"Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06195","snapshot_observed_at":"2026-08-06T18:57:13.092944Z","title":"Mutual reasoning makes smaller llms stronger problem-solvers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.092944Z"},"links":{"cited_paper":"/paper/2408.06195","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:d24e809e0c8b6eb9c798ef6454fce0162e5f4d81084657fa682a2dfcb4b134c4","observation_id":"1ab23470-2b95-42f2-8ac8-d0fe97ba9b41","resolution":{"observed_at":"2026-08-06T18:57:13.092944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-06T18:57:13.096040Z","title":"Code llama: Open foundation models for code, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.096040Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:9fb58c261171de59272aad314375bf5ae93ecdfc5b61901da547c2a1b1d7ea97","observation_id":"dedb6c62-79e1-4381-af05-d974071d4622","resolution":{"observed_at":"2026-08-06T18:57:13.096040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.821179Z","title":"Amazon codewhisperer, 2024","venue":null,"work_id":"5b6bae0f-9421-4fce-9bde-4c8750236f2b","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.099281Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:b6678ae838ebacc629abaeb80630e5d048c4cb790c43e3d98d7e501d2e4ff73f","observation_id":"db44968b-3743-45c5-aaa2-7eae9b221c1d","resolution":{"observed_at":"2026-08-06T18:57:13.824385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02047","last_updated":"2024-08-21T01:58:38Z","snapshot_observed_at":"2026-08-09T21:37:08.721719Z","submitted_at":"2024-02-03T05:52:28Z","title":"Calibration and Correctness of Language Models for Code","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02047","snapshot_observed_at":"2026-08-06T18:57:13.102050Z","title":"Quality and trust in llm- generated code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.102050Z"},"links":{"cited_paper":"/paper/2402.02047","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:3a077d4213fe219c1f6809c0decd22ed82e9ff04c73ef97622e49b8e44d4a789","observation_id":"74954589-49b8-41f1-8aa4-c9aae5fc6359","resolution":{"observed_at":"2026-08-06T18:57:13.102050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-06T18:57:13.105318Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.105318Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:aa9f6c30eb1f1c5b3627ba03ef1692233584c12be4de9a1c17a594c9908f5e51","observation_id":"0f73a6b6-88ab-49be-9bff-5e2aa94ad9c6","resolution":{"observed_at":"2026-08-06T18:57:13.105318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08937","last_updated":"2024-03-18T14:34:13Z","snapshot_observed_at":"2026-07-06T17:44:17.232428Z","submitted_at":"2024-03-13T20:12:01Z","title":"Bugs in Large Language Models Generated Code: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08937","snapshot_observed_at":"2026-08-06T18:57:13.108562Z","title":"Desmarais, and Giuliano Antoniol","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.108562Z"},"links":{"cited_paper":"/paper/2403.08937","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:03efac044b34a4b5f7a661f29582dc1b6fef70d0bc07054f55443e9d7fee2fe3","observation_id":"c2cd16ae-52fb-4962-b53a-3e929e395b55","resolution":{"observed_at":"2026-08-06T18:57:13.108562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.812238Z","title":"Code repair with llms gives an exploration-exploitation tradeoff","venue":null,"work_id":"0578eba4-2e98-430b-9bd6-22c244404652","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.111596Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:819c65a2e3a15837aaefc237432fe244fdb8807ca0e2291f2ca9b4afb5ddcd8d","observation_id":"38217dfd-d3c4-471e-8674-c43996863060","resolution":{"observed_at":"2026-08-06T18:57:13.815606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:57:13.114357Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.114357Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:b9c52f0cfad7b07256ee8813775693821cecba32d0a52e581cd300d21e6ae2e9","observation_id":"742f76d4-a924-4161-b7e2-6746303a1dee","resolution":{"observed_at":"2026-08-06T18:57:13.114357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.117461Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.117461Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:e19ee8d60f4acaec34129edde93d10da5c261f66f0b77a75f255047d1a754162","observation_id":"b6faa49c-bc50-40aa-a7a2-05acbcfa9af2","resolution":{"observed_at":"2026-08-06T18:57:13.117461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.798143Z","title":"Expectation vs","venue":null,"work_id":"2eb293d7-06cc-4c91-848c-b56fde58c0c0","year":2022},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.120602Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:e5e1dfc0a2d8094ba5af86dc54dcfe09dea9ea21e9a8c5159c14db48abc85adb","observation_id":"fa0f77b2-7ff5-4ae6-929f-ed9c8c3642ef","resolution":{"observed_at":"2026-08-06T18:57:13.801421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.123452Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.123452Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:2bcc51e81e056085afe928f6bdb3a558f7d413aa5ed6d665e410a090a78e063e","observation_id":"44cb0885-084c-434e-b6cc-0b8d01df9bad","resolution":{"observed_at":"2026-08-06T18:57:13.123452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.783527Z","title":"Using github copilot to solve simple programming problems","venue":null,"work_id":"24c7c3a0-9c78-4114-abc1-c271aba9abf3","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.126255Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:ff57178ca3726c8bfb321b7b5530e635f12fb3aff9b565b6e5189a7bba9b0760","observation_id":"b9478c76-6c3f-4f23-b454-ca30fe6e3452","resolution":{"observed_at":"2026-08-06T18:57:13.786801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01489","last_updated":"2024-10-29T17:29:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T17:24:45Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01489","snapshot_observed_at":"2026-08-06T18:57:13.129076Z","title":"Agentless: Demystifying llm- based software engineering agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.129076Z"},"links":{"cited_paper":"/paper/2407.01489","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:117b0e70102dac6ea41c36598d3bc7a8b906e34637b39de3561c8414332c060d","observation_id":"8ec48f14-0c06-4991-a1aa-9c8606220ce2","resolution":{"observed_at":"2026-08-06T18:57:13.129076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.774585Z","title":"Demystifying llm-based software en- gineering agents","venue":null,"work_id":"dd66ef02-76cb-4a77-ad05-724e2a3fd4ef","year":2025},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.132297Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:75ce3a6dd9b09906a7a185acf1d7b50de36c191e37088d56e59078518292b11f","observation_id":"21c5a2ce-f01a-44d3-961e-dbda073ef8af","resolution":{"observed_at":"2026-08-06T18:57:13.777752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.766027Z","title":"Self- evaluation guided beam search for reasoning","venue":null,"work_id":"075a1e18-56ab-4d94-bd6f-71c3dacc3b0e","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.134962Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:076743445217164f10a22a05839747c4b07dffb6a49d006fcee8c3d8849daf6e","observation_id":"189cd40d-6060-4559-9255-5475497315fb","resolution":{"observed_at":"2026-08-06T18:57:13.769096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-06T18:57:13.137811Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.137811Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:bfd5a22786412913a46f654a2e85e0b9006e701eba80a88757da718a4ed552a2","observation_id":"6216f725-8dfc-4c42-a584-667df91f637a","resolution":{"observed_at":"2026-08-06T18:57:13.137811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.757151Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"8694c43c-d622-47cf-8b2c-a16668b96326","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.140899Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:8970fd1d5383d1d2861c8d8ee95132c1e270cb684ea67af89e1607b4caaa59da","observation_id":"4486a841-2aad-405e-b4ff-bfb4a2205713","resolution":{"observed_at":"2026-08-06T18:57:13.760345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.748524Z","title":"Framework for evalu- ating code generation ability of large language models","venue":null,"work_id":"6dd677cc-d3c5-459b-aa4a-2b9a47fcce6a","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.143896Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:988813c68459ab6d5cf62cbbca4c629be18b4951ac16ad73c79f5882ae12e260","observation_id":"0213a368-cc4d-48a4-a603-1554521f1d9c","resolution":{"observed_at":"2026-08-06T18:57:13.751610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03624","last_updated":"2024-08-26T08:09:39Z","snapshot_observed_at":"2026-08-03T08:25:18.092015Z","submitted_at":"2024-07-04T04:19:50Z","title":"Question-Analysis Prompting Improves LLM Performance in Reasoning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03624","snapshot_observed_at":"2026-08-06T18:57:13.146831Z","title":"Question-analysis prompting improves llm performance in reasoning tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.146831Z"},"links":{"cited_paper":"/paper/2407.03624","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:aebf2b92553be4e09e3177f6c15e290b561c161835dae0619c146803126620bf","observation_id":"8dbffacd-d2e2-48b2-93b9-8ecc1bef1d57","resolution":{"observed_at":"2026-08-06T18:57:13.146831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.149843Z","title":"Learning-based widget matching for migrating gui test cases","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.149843Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:5f65a544da19b9b788685ea3f956d6b0a460bcf41080b70381db3c3cb9ee7a39","observation_id":"27c36329-ccc9-4fb1-a4f2-2a3602d51c47","resolution":{"observed_at":"2026-08-06T18:57:13.149843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13227","last_updated":"2023-10-20T02:24:35Z","snapshot_observed_at":"2026-08-07T00:35:09.723451Z","submitted_at":"2023-10-20T02:24:35Z","title":"ToolChain*: Efficient Action Space Navigation in Large Language Models with A* Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13227","snapshot_observed_at":"2026-08-06T18:57:13.152676Z","title":"Toolchain*: Efficient action space navi- gation in large language models with a* search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.152676Z"},"links":{"cited_paper":"/paper/2310.13227","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:594d65011d504f1c354c92a1dbfcb18530bb5d98463b95ed9fe58d4dc60d017e","observation_id":"cd830f19-23cf-4218-b2d1-0d95568360ef","resolution":{"observed_at":"2026-08-06T18:57:13.152676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.038475Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.038475Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:f94f14dcae299aa96e9895619bb90ea58499b3945da1b8181b163ac3b887e0c6","observation_id":"3998ee99-e134-430a-a740-63a4965287f0","resolution":{"observed_at":"2026-08-06T18:57:13.038475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-09T16:46:36.256784Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2507.06980."}