{"as_of":"2026-08-09T14:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3af94807ffe722531e923436fca7b36d704cd298e09278204029d926040dd86b","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:16:42.794738Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T08:17:10.481202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"cited_work":{"arxiv_id":"2507.00699","doi":"10.48550/arxiv.2507.00699","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":"ArXiv.org","work_id":"b83bc13e-faba-4a19-976d-bc6f0e36e264","year":2025},"citing_paper":{"arxiv_id":"2605.05267","last_updated":"2026-05-06T09:38:31Z","snapshot_observed_at":"2026-08-04T17:41:12.164736Z","submitted_at":"2026-05-06T09:38:31Z","title":"Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T17:37:51.790000Z"},"links":{"cited_paper":"/paper/2507.00699","citing_paper":"/paper/2605.05267"},"observation_digest":"sha256:4dafd4f3a00ed5536a9b646781efb6f3176edcdd9875315b2f9ebda7217f3cbf","observation_id":"39c86638-d467-4dad-9eba-bfbb7c127715","resolution":{"observed_at":"2026-05-11T17:21:11.028874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"cited_work":{"arxiv_id":"2507.00699","doi":"10.48550/arxiv.2507.00699","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":"ArXiv.org","work_id":"b83bc13e-faba-4a19-976d-bc6f0e36e264","year":2025},"citing_paper":{"arxiv_id":"2605.30219","last_updated":"2026-05-28T16:52:04Z","snapshot_observed_at":"2026-08-08T08:09:40.420385Z","submitted_at":"2026-05-28T16:52:04Z","title":"When Should Models Change Their Minds? Contextual Belief Management in Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-29T07:17:07.720589Z"},"links":{"cited_paper":"/paper/2507.00699","citing_paper":"/paper/2605.30219"},"observation_digest":"sha256:aa45be47ae9d37a28798918eca3f0d5539c891327d9eba51167b802df0e56d35","observation_id":"290c59ff-805d-4373-ba60-59b11e8a9b3e","resolution":{"observed_at":"2026-06-29T07:23:12.976976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"cited_work":{"arxiv_id":"2507.00699","doi":"10.48550/arxiv.2507.00699","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":"ArXiv.org","work_id":"b83bc13e-faba-4a19-976d-bc6f0e36e264","year":2025},"citing_paper":{"arxiv_id":"2606.07539","last_updated":"2026-04-29T17:39:36Z","snapshot_observed_at":"2026-08-02T12:30:34.186010Z","submitted_at":"2026-04-29T17:39:36Z","title":"Prompt Governance? On Governing Technologies Governed by Natural Language","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-01T08:17:10.481202Z"},"links":{"cited_paper":"/paper/2507.00699","citing_paper":"/paper/2606.07539"},"observation_digest":"sha256:56e81fefd8a6373c6bd12804bf3af9a0dde5635d724dfbb97106fc0b6dd49fbb","observation_id":"57e95625-d60e-4a7b-a963-890c4f78eb3d","resolution":{"observed_at":"2026-07-01T08:25:32.385646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"cited_work":{"arxiv_id":"2507.00699","doi":"10.48550/arxiv.2507.00699","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":"ArXiv.org","work_id":"b83bc13e-faba-4a19-976d-bc6f0e36e264","year":2025},"citing_paper":{"arxiv_id":"2606.25747","last_updated":"2026-06-30T12:52:08Z","snapshot_observed_at":"2026-08-02T12:27:31.060186Z","submitted_at":"2026-06-24T12:16:04Z","title":"CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T20:22:29.287534Z"},"links":{"cited_paper":"/paper/2507.00699","citing_paper":"/paper/2606.25747"},"observation_digest":"sha256:e4d1b07523fe9fe63bf74b18300501093acf60a37443d089dac8626282b90845","observation_id":"c805b868-143f-4aaf-89c6-f46868efae58","resolution":{"observed_at":"2026-07-04T20:20:06.984330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"cited_work":{"arxiv_id":"2507.00699","doi":"10.48550/arxiv.2507.00699","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":"ArXiv.org","work_id":"b83bc13e-faba-4a19-976d-bc6f0e36e264","year":2025},"citing_paper":{"arxiv_id":"2606.25747","last_updated":"2026-06-30T12:52:08Z","snapshot_observed_at":"2026-08-02T12:27:31.060186Z","submitted_at":"2026-06-24T12:16:04Z","title":"CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T07:05:50.811872Z"},"links":{"cited_paper":"/paper/2507.00699","citing_paper":"/paper/2606.25747"},"observation_digest":"sha256:29c2b99625af696f0cbd1de352432407e8097cbe430b041e13c56bbcb7d331ee","observation_id":"9f50b92b-d06f-40a4-a0b3-2d24dcfef8ae","resolution":{"observed_at":"2026-07-01T08:55:35.347673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00699/citation-record","integrity":"/paper/2507.00699/integrity","json":"/paper/2507.00699/citation-record.json","paper":"/paper/2507.00699"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:40.649612Z","title":"Soen-101: Code generation by emulating software process models using large language model agents,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:40.649612Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:02def030193613798a3504204429a21218e91d70b6feea5553f5c4b2f4bb9d3c","observation_id":"98959035-344d-4dd5-b524-8cc2a7ddf776","resolution":{"observed_at":"2026-08-06T21:16:40.649612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07112","last_updated":"2025-03-22T13:56:52Z","snapshot_observed_at":"2026-08-09T01:22:43.808007Z","submitted_at":"2024-11-11T16:39:13Z","title":"ROCODE: Integrating Backtracking Mechanism and Program Analysis in Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07112","snapshot_observed_at":"2026-08-06T21:16:40.840152Z","title":"Rocode: Integrating backtracking mechanism and program analysis in large language models for code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:40.840152Z"},"links":{"cited_paper":"/paper/2411.07112","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:8c256c5746c1c9902c3a4e5b0e607fb28d565b7f55038add2fe224544016dad4","observation_id":"d930fc1b-9079-4376-9294-e8d94752079b","resolution":{"observed_at":"2026-08-06T21:16:40.840152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:40.912600Z","title":"Skcoder: A sketch-based approach for automatic code generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:40.912600Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:9de5a5e789ed450fc6725f43829da256f502b711158b983d1fd7fb3325ade0b3","observation_id":"815bdd69-f192-49d1-a45f-c0730df2b1fd","resolution":{"observed_at":"2026-08-06T21:16:40.912600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07768","last_updated":"2025-05-12T17:20:30Z","snapshot_observed_at":"2026-08-07T15:47:47.825638Z","submitted_at":"2025-05-12T17:20:30Z","title":"Enhancing Code Generation via Bidirectional Comment-Level Mutual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07768","snapshot_observed_at":"2026-08-06T21:16:40.926501Z","title":"Enhancing code generation via bidirectional comment-level mutual grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:40.926501Z"},"links":{"cited_paper":"/paper/2505.07768","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:2200a9c4a8af1fbc3b2b5f8d3628a44e304218407750ba4c32a0fbf4b12ab8b7","observation_id":"05f51ad5-7b73-48d2-af70-60563fdb60ed","resolution":{"observed_at":"2026-08-06T21:16:40.926501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16120","last_updated":"2024-12-19T05:18:33Z","snapshot_observed_at":"2026-08-08T16:06:19.137358Z","submitted_at":"2023-09-28T02:58:07Z","title":"Fixing Large Language Models' Specification Misunderstanding for Better Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16120","snapshot_observed_at":"2026-08-06T21:16:41.068895Z","title":"Fixing large language models’ specification misunderstanding for better code generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.068895Z"},"links":{"cited_paper":"/paper/2309.16120","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:3f74c39c3f3cebb561f0179e740b100f83a4a12d48714adb9f0a8053872add13","observation_id":"e0d3c8c6-b55a-49ef-ad5e-effa4a22987b","resolution":{"observed_at":"2026-08-06T21:16:41.068895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T21:16:41.283330Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.283330Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:456a109d01250b25cdf40f032f80c4f081fe43d5c1d4e13f438496125eadc4ae","observation_id":"b61f1b99-39fe-4665-b59b-aa73c79502a7","resolution":{"observed_at":"2026-08-06T21:16:41.283330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T21:16:41.360449Z","title":"Program synthesis with large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.360449Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:b94cafdb27f4d9da77c5d962a9306856a1bef15c0bb987b1762bfd0ac5a4ea49","observation_id":"b47c095f-2342-44b3-9824-95727e3a39bc","resolution":{"observed_at":"2026-08-06T21:16:41.360449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-06T21:16:41.365515Z","title":"A survey on evaluating large language models in code generation tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.365515Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:521ba2a56f71a1d9b40f934a906519149a21e232b2a7aaee0cd96917bda52f18","observation_id":"3bc9bdaa-f0df-4836-91cb-e64f7b267922","resolution":{"observed_at":"2026-08-06T21:16:41.365515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:41.453046Z","title":"Instruction-following evaluation for large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.453046Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:a54e8ae42b0d7304f3f1ab541c793ced5dcf8ae68c26fb87750033267935699a","observation_id":"43c39c9e-b5aa-4659-bec4-0e0753fedd37","resolution":{"observed_at":"2026-08-06T21:16:41.453046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03601","last_updated":"2024-01-07T23:01:56Z","snapshot_observed_at":"2026-08-07T08:24:45.140295Z","submitted_at":"2024-01-07T23:01:56Z","title":"InFoBench: Evaluating Instruction Following Ability in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03601","snapshot_observed_at":"2026-08-06T21:16:41.489193Z","title":"Infobench: Evaluating instruction following ability in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.489193Z"},"links":{"cited_paper":"/paper/2401.03601","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:88cdd6af437b5979787ca31bcc681e499881710af64da3c5f87192c0bc2f47a1","observation_id":"da751ba6-c1d1-47df-985f-5a1f713dda1c","resolution":{"observed_at":"2026-08-06T21:16:41.489193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19166","last_updated":"2025-08-04T07:46:55Z","snapshot_observed_at":"2026-08-07T17:46:05.592953Z","submitted_at":"2025-02-26T14:19:49Z","title":"CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19166","snapshot_observed_at":"2026-08-06T21:16:41.524744Z","title":"Codeif: Benchmarking the instruction-following capabilities of large language models for code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.524744Z"},"links":{"cited_paper":"/paper/2502.19166","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:e9c88c8ac4387ce33686e89b51a95f6cfb64a66799cebb8ffd653170c6bb1a90","observation_id":"f1774027-b0c4-4f17-81a5-df9a12cc59c7","resolution":{"observed_at":"2026-08-06T21:16:41.524744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:41.559939Z","title":"Codeif-bench: Evaluating instruction-following capabilities of large language models in interactive code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.559939Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:1670ae856b3f93024912361717eb15802ae2f60d8c73299b741f20b96c61c48d","observation_id":"1193c980-a560-4bd8-85e2-898adf58dbbe","resolution":{"observed_at":"2026-08-06T21:16:41.559939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:48.018339Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":null,"work_id":"aef8163a-df81-4a2c-a105-6ee7f5bd83f7","year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.648086Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:713118fdb13125a49c6ad8813415c9c85fcc57ce72cb53ca266b15fc33af08a3","observation_id":"79701b5d-baf1-4604-9754-541bf883a75a","resolution":{"observed_at":"2026-08-06T21:16:48.065482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00456","last_updated":"2025-06-21T17:44:03Z","snapshot_observed_at":"2026-07-06T18:38:54.776114Z","submitted_at":"2024-06-29T14:56:11Z","title":"Beyond Functional Correctness: Investigating Coding Style Inconsistencies in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00456","snapshot_observed_at":"2026-08-06T21:16:41.671896Z","title":"Beyond functional correctness: Investigating coding style inconsistencies in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.671896Z"},"links":{"cited_paper":"/paper/2407.00456","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:fb4ce93bece7549dbbfb26c0995aa015359dd8247a50e54768cdbf4fb81ffe84","observation_id":"ea3e0791-063d-489c-a370-71143a52ca3b","resolution":{"observed_at":"2026-08-06T21:16:41.671896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20410","last_updated":"2024-06-05T15:39:26Z","snapshot_observed_at":"2026-08-08T02:42:16.160487Z","submitted_at":"2023-10-31T12:32:38Z","title":"FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20410","snapshot_observed_at":"2026-08-06T21:16:41.694748Z","title":"Followbench: A multi-level fine- grained constraints following benchmark for large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.694748Z"},"links":{"cited_paper":"/paper/2310.20410","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:51afa8d3eb18f056fd29f488c7e67e398199e29dff0e33e93a4ac944a58a41c9","observation_id":"cea143ab-1230-4175-9893-9bb48f9b74f8","resolution":{"observed_at":"2026-08-06T21:16:41.694748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:47.835046Z","title":"Sharegpt,","venue":null,"work_id":"77820d1c-2606-41f8-a270-0bdf9a2c65ad","year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.734747Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:afd9dd2d6d879e905604cc746bfc52fffaab35d7217922158ca910d337b5361f","observation_id":"bb171d85-fe5a-43b1-837c-f0361ca7f398","resolution":{"observed_at":"2026-08-06T21:16:47.895647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17176","last_updated":"2025-05-04T13:32:32Z","snapshot_observed_at":"2026-07-06T20:27:32.742145Z","submitted_at":"2025-01-24T08:15:05Z","title":"Prompt-Based Cost-Effective Evaluation and Operation of ChatGPT as a Computer Programming Teaching Assistant","version":3},"cited_work":{"arxiv_id":"2501.17176","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.17176","snapshot_observed_at":"2026-08-06T21:16:45.447354Z","title":"Prompt-Based Cost-Effective Evaluation and Operation of ChatGPT as a Computer Programming Teaching Assistant","venue":"cs.CY","work_id":"b5d90f2c-2d4d-49f3-9499-80506da5d0ea","year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.784746Z"},"links":{"cited_paper":"/paper/2501.17176","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:4128c1528f0a0f4a8a9696cad8508fd599e00c93ee669562a5a615dbc922660e","observation_id":"f6eabef0-6a5c-4206-bbcc-a25731a628f8","resolution":{"observed_at":"2026-08-06T21:16:45.463009Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.15531772","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:43.075030Z","title":"tree-sitter/tree-sitter: v0.25.5,","venue":null,"work_id":"0446a91e-867d-4e27-9c03-34f38f6bdeb4","year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.819239Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:ac3b9ae66ed5eb3a2bbb6b271674a0456bb132a341e45a17e7bcda141f730a89","observation_id":"1e647956-e148-494d-8d08-dc3e467a846e","resolution":{"observed_at":"2026-08-06T21:16:43.134792Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:16:41.874749Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.874749Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:a1cc2211ff3efedecff56097a3a8cd4c2a613eaff8d2078d2d0aba840746e187","observation_id":"a19eca15-2d4a-4f3a-9595-400190df6f7e","resolution":{"observed_at":"2026-08-06T21:16:41.874749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:47.424766Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":"b3cd3655-397f-4746-8ecb-9e20dbb6a8b8","year":2004},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.914739Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:1db5e954693bf881ad949142743cc15cafba9781d946d7142c72fca8cfde97bb","observation_id":"e6c825af-d137-4486-9936-ea7107ce2302","resolution":{"observed_at":"2026-08-06T21:16:47.604770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:16:41.937129Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.937129Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:4a8fe42033ae81a681189854d405d331a092c2d714984559228d29c18928378a","observation_id":"5a0c9c0b-bf7f-4272-9ae4-e7c2665ef132","resolution":{"observed_at":"2026-08-06T21:16:41.937129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:47.010788Z","title":"Claude 3.7 sonnet and claude code,","venue":null,"work_id":"ae18f9a0-7df4-4a76-a8cd-7ff6d8cce9da","year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.963659Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:fbdd486a868abace58e3bfadebaf0ef6a448ccb540da61cb4980cb2a9a8f3ca3","observation_id":"26e3e459-d30c-460a-a7ed-295320b0c912","resolution":{"observed_at":"2026-08-06T21:16:47.186490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:16:41.994749Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.994749Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:d3c2ce8468167723c86c16a8273b3371e1b8de0342f46711e7112b9bdedde531","observation_id":"84baed67-510b-43ca-b183-a206c5ce0c6f","resolution":{"observed_at":"2026-08-06T21:16:41.994749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T21:16:42.034748Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.034748Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:982a43c9f4b2a87c7a62804c522d6cd1cb9a64b4bb876434d67350405bb29cea","observation_id":"8abd2f57-2fd9-40f2-8480-f908485b89dd","resolution":{"observed_at":"2026-08-06T21:16:42.034748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T21:16:42.094905Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.094905Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:b121a31f2b013ac1f250932ce9b9f89e27edc44792c2048829d6e09e8de071d4","observation_id":"7a297632-837c-4105-8ad7-12f0e53f9b6d","resolution":{"observed_at":"2026-08-06T21:16:42.094905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:16:42.134745Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.134745Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:7ae786107f60a8966f1466dd9d5c2046bea8096d9e842a37294940a6d7759d63","observation_id":"1927e71d-37ba-4f26-8e8d-3d54415b000e","resolution":{"observed_at":"2026-08-06T21:16:42.134745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:42.174750Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.174750Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:201c6d4f1940218220e2fc73f961b36d4aa1c77c6bf3a1c3c4f65d1335ee6a21","observation_id":"37067ce1-3533-4b5b-ac4f-c3abc6105d35","resolution":{"observed_at":"2026-08-06T21:16:42.174750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:46.675249Z","title":"Guesslang: A neural network to guess the programming language from code snippet,","venue":null,"work_id":"950aa49c-0788-45a7-b8c7-b05bf3ba5f07","year":2019},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.225023Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:4aff534f9436ef85c4d65948db24a6bf12712b839e9ffcdd6d074236316eded4","observation_id":"984bcaa4-5042-4ed1-8926-f2ea96675d1d","resolution":{"observed_at":"2026-08-06T21:16:46.819549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-09T13:53:26.987097Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-06T21:16:42.274834Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.274834Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:27725f020df4bb8dd6c38e57d1fb5ab25fe138a920e1d1321ad563b1e87892cd","observation_id":"154ca5db-694d-4241-b4e1-f0df76995d2e","resolution":{"observed_at":"2026-08-06T21:16:42.274834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01861","last_updated":"2023-08-14T09:07:00Z","snapshot_observed_at":"2026-08-03T22:16:12.497107Z","submitted_at":"2023-08-03T16:31:02Z","title":"ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01861","snapshot_observed_at":"2026-08-06T21:16:42.308763Z","title":"Classeval: A manually-crafted benchmark for evaluating llms on class-level code generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.308763Z"},"links":{"cited_paper":"/paper/2308.01861","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:d0fd4969fc9e934d0f18edb94640963b434101dff3549693bf0dbf37e7aac5ea","observation_id":"a938fd60-4e67-407d-864f-5b65fe7c3f08","resolution":{"observed_at":"2026-08-06T21:16:42.308763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:42.314114Z","title":"Learning-based widget matching for migrating gui test cases,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.314114Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:3df090a0510461721411f0f22a3fb9d433126ca210270bbc742901a2f3dfd4f7","observation_id":"72cdc08a-3578-47b8-8024-0aced3a8923c","resolution":{"observed_at":"2026-08-06T21:16:42.314114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19856","last_updated":"2024-05-30T09:03:42Z","snapshot_observed_at":"2026-08-07T16:25:45.458310Z","submitted_at":"2024-05-30T09:03:42Z","title":"DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19856","snapshot_observed_at":"2026-08-06T21:16:42.331104Z","title":"Deveval: A manually-annotated code generation benchmark aligned with real-world code repositories,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.331104Z"},"links":{"cited_paper":"/paper/2405.19856","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:8dbdebb060cd4eb148c0ea4713b8465e5d2167f6b4cdfe3e970cb497e972e780","observation_id":"e6008267-b874-4237-a2fc-97efca23c204","resolution":{"observed_at":"2026-08-06T21:16:42.331104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16922","last_updated":"2025-03-21T07:33:59Z","snapshot_observed_at":"2026-08-07T16:47:17.113884Z","submitted_at":"2025-03-21T07:33:59Z","title":"RustEvo^2: An Evolving Benchmark for API Evolution in LLM-based Rust Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16922","snapshot_observed_at":"2026-08-06T21:16:42.334629Z","title":"Rustevoˆ 2: An evolving benchmark for api evolution in llm-based rust code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.334629Z"},"links":{"cited_paper":"/paper/2503.16922","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:8283a3849d68c126574406f3f054ed2e9593200ba4d3b3bd9eed56be1808f9b8","observation_id":"459eb448-1417-48ee-bb16-61b7931bcb71","resolution":{"observed_at":"2026-08-06T21:16:42.334629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:42.374745Z","title":"Feedbackeval: A benchmark for evaluating large language models in feedback-driven code repair tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.374745Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:f21e685804e16518c0b834c7c5497f27a6fed9a327fa9a453964e9882c0151e8","observation_id":"b0b49b14-e3ac-4ed8-9abc-f6418ac8b6db","resolution":{"observed_at":"2026-08-06T21:16:42.374745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:46.629301Z","title":"Benchmarking complex instruction-following with multiple constraints composition,","venue":null,"work_id":"239fb0ac-b5da-4fd6-9dab-40f1e46edbde","year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.424811Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:320b6a4647c939d7771783264b1d364d4aa2103189b10f955574ba713bb0ff1c","observation_id":"a95a8c12-ebd9-42f2-bcf9-72e7ba49ac5e","resolution":{"observed_at":"2026-08-06T21:16:46.644479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03351","last_updated":"2024-10-04T12:17:08Z","snapshot_observed_at":"2026-07-06T19:27:37.936219Z","submitted_at":"2024-10-04T12:17:08Z","title":"Generating Equivalent Representations of Code By A Self-Reflection Approach","version":1},"cited_work":{"arxiv_id":"2410.03351","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03351","snapshot_observed_at":"2026-08-06T21:16:43.965719Z","title":"Generating Equivalent Representations of Code By A Self-Reflection Approach","venue":"cs.CL","work_id":"b3d39bd7-0e25-4794-9495-56819a7544f4","year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.503377Z"},"links":{"cited_paper":"/paper/2410.03351","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:8faf0617a18037109eb2af31fdf671790b6edd5693d56043e6184434ce0b8033","observation_id":"472da2bc-29fc-4846-9f68-71cf6927d5ff","resolution":{"observed_at":"2026-08-06T21:16:44.004826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:42.546851Z","title":"Codescore: Evaluating code generation by learning code execution,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.546851Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:0edc56c06be703eac4ec6e2134605869c7ea8165433d6fa2aff73b60432d9078","observation_id":"674a015e-81df-4cc0-8811-24c3c0e410d4","resolution":{"observed_at":"2026-08-06T21:16:42.546851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03978","last_updated":"2024-10-31T08:11:04Z","snapshot_observed_at":"2026-07-06T18:41:35.995594Z","submitted_at":"2024-07-04T14:50:45Z","title":"Benchmarking Complex Instruction-Following with Multiple Constraints Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03978","snapshot_observed_at":"2026-08-06T21:16:42.464751Z","title":"Available: https://arxiv.org/abs/2407.03978","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.464751Z"},"links":{"cited_paper":"/paper/2407.03978","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:d803874b99b13418cd7d01f04a8d44ecae4b75f3b28fead9031e2381b6e90c0d","observation_id":"d0639506-78c1-4147-a23d-9a7d2faeb7e1","resolution":{"observed_at":"2026-08-06T21:16:42.464751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-06T21:16:42.626496Z","title":"Wizardlm: Empowering large pre-trained language models to follow complex instructions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.626496Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:5025f77b8beb1e79fe441895f8d9f6fa9c24369cfcbc4bd2d3972ca6bbd80476","observation_id":"40aa013e-3916-4b50-84d9-62400e7e56f0","resolution":{"observed_at":"2026-08-06T21:16:42.626496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02120","last_updated":"2024-06-07T02:50:56Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:50:35Z","title":"Magicoder: Empowering Code Generation with OSS-Instruct","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02120","snapshot_observed_at":"2026-08-06T21:16:42.654739Z","title":"Magicoder: Empowering code generation with oss-instruct,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.654739Z"},"links":{"cited_paper":"/paper/2312.02120","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:a62eaa1b03c33e95df857617d769a540cf791f5ab90584d9debca6faaaa3ab43","observation_id":"ca44739c-0b3f-4e91-aadd-61e8e4bc0971","resolution":{"observed_at":"2026-08-06T21:16:42.654739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-06T21:16:42.591153Z","title":"Self-instruct: Aligning language models with self-generated instructions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.591153Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:10dc7ca952722c5543779c8d2d8414c3a9209ec1978425993e3471a3dd57591e","observation_id":"7d317827-9bbe-47f6-a99c-de1dfb3fb9b5","resolution":{"observed_at":"2026-08-06T21:16:42.591153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:46.594470Z","title":"Genetic instruct: Scaling up synthetic generation of coding instructions for large language models,","venue":null,"work_id":"c87eae8f-b76e-4f85-94af-fd8eea76c894","year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.750003Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:3b595e3623279df47c0c864cfb6dec6ee302dd0eeb6ab2c879f0400bbffa29d6","observation_id":"57834f6e-a9ec-4a0c-8657-fbc15a330194","resolution":{"observed_at":"2026-08-06T21:16:46.608394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14187","last_updated":"2024-06-07T07:46:28Z","snapshot_observed_at":"2026-07-06T17:06:45.522731Z","submitted_at":"2023-12-20T09:02:29Z","title":"WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14187","snapshot_observed_at":"2026-08-06T21:16:42.694742Z","title":"Wavecoder: Widespread and versatile enhancement for code large language models by instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.694742Z"},"links":{"cited_paper":"/paper/2312.14187","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:6a92f35dafe7ff0f780670ee2e782487a7208e2481ffd83948d9cadbb13577ce","observation_id":"9b693b4d-0478-4898-8651-a21d4f48dba9","resolution":{"observed_at":"2026-08-06T21:16:42.694742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-06T21:16:41.484523Z","title":"Available: https://arxiv.org/abs/2311.07911","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.484523Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:be0ef66c50c0592ab631bae2dcff31b7cbf706cd2afdd7c38322c0d36ff7c6fc","observation_id":"54853ea3-73e6-4c99-80e1-4982df7be0bd","resolution":{"observed_at":"2026-08-06T21:16:41.484523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15852","last_updated":"2024-10-31T14:43:58Z","snapshot_observed_at":"2026-07-06T17:49:28.257497Z","submitted_at":"2024-03-23T14:04:48Z","title":"SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15852","snapshot_observed_at":"2026-08-06T21:16:40.724767Z","title":"Available: https://arxiv.org/abs/2403.15852","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:40.724767Z"},"links":{"cited_paper":"/paper/2403.15852","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:a0662a1b6f9a6b5e423fa63d9db137ded95622705e44ebb4d1618c894a2f7a13","observation_id":"918c7b8c-6c40-4878-8711-7b74779eb127","resolution":{"observed_at":"2026-08-06T21:16:40.724767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21077","last_updated":"2025-05-22T23:36:42Z","snapshot_observed_at":"2026-08-09T03:20:04.715085Z","submitted_at":"2024-07-29T20:42:59Z","title":"Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21077","snapshot_observed_at":"2026-08-06T21:16:42.794738Z","title":"Available: https://arxiv.org/abs/2407.21077","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.794738Z"},"links":{"cited_paper":"/paper/2407.21077","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:28b211917c88e2afe4dbbe2e52e832d7cf7829dad801aefd694ac8141263364c","observation_id":"eabb4b14-24c4-49af-a418-bedcec7e29c1","resolution":{"observed_at":"2026-08-06T21:16:42.794738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-09T09:53:46.791318Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":3,"verified_fuzzy":7},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 5 inbound Pith citation observations for arXiv:2507.00699."}