{"as_of":"2026-08-11T20:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d04da6439c00f6edda5ca6e83847596d7ba129eaff27f0607b8208557787a54a","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T20:39:00.617619Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16569/citation-record","integrity":"/paper/2607.16569/integrity","json":"/paper/2607.16569/citation-record.json","paper":"/paper/2607.16569"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.479834Z","title":"Repairing deep neural networks: Fix patterns and challenges,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.479834Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:0bd2b69ba2cb731282852dc57a8836cf4364808ec22f71267db3fc29e60dc858","observation_id":"a3801244-e99a-4587-88af-43b8c64dc68b","resolution":{"observed_at":"2026-08-01T20:38:55.479834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08632","last_updated":"2023-06-14T16:50:01Z","snapshot_observed_at":"2026-08-10T19:22:02.464759Z","submitted_at":"2023-06-14T16:50:01Z","title":"Characterizing Bugs in Python and R Data Analytics Programs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08632","snapshot_observed_at":"2026-08-01T20:38:55.530742Z","title":"Charac- terizing bugs in python and r data analytics programs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.530742Z"},"links":{"cited_paper":"/paper/2306.08632","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:81906ac49ea6392084bdd5c4476a646f732a50cfc16e6a8c70d870223f4cf5ad","observation_id":"ec1ffc61-07e8-46fb-87f2-45bc11fb1864","resolution":{"observed_at":"2026-08-01T20:38:55.530742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.599291Z","title":"Towards understanding performance bugs in popular data science libraries,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.599291Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:f1a361a9ef52e425024d96c161385ec53094e91fa3cf1ba50634bcda85df2c36","observation_id":"f3b2b4ea-c7be-487c-84e3-101c61eed01b","resolution":{"observed_at":"2026-08-01T20:38:55.599291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.729697Z","title":"Towards understanding fine-grained programming mistakes and fixing patterns in data science,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.729697Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:bef24636231a357319fb3a195dda7efee48bfa76a5684a1c2a899e3f203f8f64","observation_id":"85507504-ba06-476c-bc62-3b5df31bb8f3","resolution":{"observed_at":"2026-08-01T20:38:55.729697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.845230Z","title":"Bug analysis in jupyter notebook projects: An empirical study,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.845230Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:97ee5e063b0b6759672d3b252dfcf40c2c55fdf1d739ea72f5852bd496b54831","observation_id":"e5e22fb2-0db4-4350-8f8f-807fbdec270d","resolution":{"observed_at":"2026-08-01T20:38:55.845230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.930133Z","title":"Why do machine learning notebooks crash? an empirical study on public python jupyter notebooks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.930133Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:9dee84e8272cf300bebb9b2fe7176a35725231dde43745be7aaccc48bb4c6f09","observation_id":"22c7e398-bb87-4f7f-a343-0fbdc0bb2b49","resolution":{"observed_at":"2026-08-01T20:38:55.930133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:55.994151Z","title":"Studying vulnerable code entities in r,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:55.994151Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:e62434de705526ee208c5fe82e71c82c4e8a08ba9fa589cc6dc9781f7ee7a1aa","observation_id":"a77c61ba-988f-4cd7-9e1b-19dcfb18ef45","resolution":{"observed_at":"2026-08-01T20:38:55.994151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09771","last_updated":"2025-02-13T21:00:21Z","snapshot_observed_at":"2026-08-09T08:28:27.048127Z","submitted_at":"2025-02-13T21:00:21Z","title":"Knowledge-Enhanced Program Repair for Data Science Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09771","snapshot_observed_at":"2026-08-01T20:38:56.102195Z","title":"Knowledge- enhanced program repair for data science code,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.102195Z"},"links":{"cited_paper":"/paper/2502.09771","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:c0d797a37af5c5d906f854c0e8c03ca39395f01927e7e32215c58fbe4d1fba6d","observation_id":"f84bcaf0-84cf-4bd8-8e79-b206801ba279","resolution":{"observed_at":"2026-08-01T20:38:56.102195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.206570Z","title":"Specrover: Code intent extraction via llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.206570Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:6966a11a4c3c88a42c5fd7cebe64217dfb0cecd4b8460af535c4ab90dec37e47","observation_id":"c864d44e-5bda-4b52-a3ae-4d9506ffc2ab","resolution":{"observed_at":"2026-08-01T20:38:56.206570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.274449Z","title":"How effective are llms for data science coding? a controlled experiment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.274449Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:ee95deef2a5ec890777a3f2bbf797c38e019a3dcc0dd0a5abd3e5767d107e1c3","observation_id":"dcd74a92-7787-4737-8c4b-51ab070af6ec","resolution":{"observed_at":"2026-08-01T20:38:56.274449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.386871Z","title":"Improving patch correctness analysis via random testing and large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.386871Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:95f3bf4be39340d685e6116d962e5715956cf3d97ba42ce4eecdacfa60d94c55","observation_id":"540bc014-deb2-4a69-9f64-d42364df4bd7","resolution":{"observed_at":"2026-08-01T20:38:56.386871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.503514Z","title":"Do current language models support code intelligence for r programming language?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.503514Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:6e209682fa07f90bd15c2614fa27988ff480f29b216d1fa6848f7126d702a651","observation_id":"b41d7cf1-7797-49ad-9f8d-7ed9b865d258","resolution":{"observed_at":"2026-08-01T20:38:56.503514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.646789Z","title":"Can llms replace human evaluators? an empirical study of llm-as-a-judge in software engineering,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.646789Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:5ca719c87449d7afa88a866777e65b3da116a36674a7a01052df76f68c57db03","observation_id":"7b791086-016f-4091-a4f6-9a3b039b6295","resolution":{"observed_at":"2026-08-01T20:38:56.646789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.926962Z","title":"Patch correctness assessment: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.926962Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:f2ca6b7e84b14acc23cc0b96fdf221c17a67fab1409cc5a1da96949087ae0e96","observation_id":"e3ad60d8-1b80-4c0b-b6c2-bb091f8605f4","resolution":{"observed_at":"2026-08-01T20:38:56.926962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00202","last_updated":"2024-03-22T09:09:15Z","snapshot_observed_at":"2026-07-06T14:57:09.595092Z","submitted_at":"2023-03-01T03:12:11Z","title":"PatchZero: Zero-Shot Automatic Patch Correctness Assessment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00202","snapshot_observed_at":"2026-08-01T20:38:57.042547Z","title":"Patchzero: Zero-shot automatic patch correctness assessment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.042547Z"},"links":{"cited_paper":"/paper/2303.00202","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:3f183b9b4f9c8908a6f7786d12dd4413cf96c4a1da3822a58a69d32212e734a2","observation_id":"c7228b25-89a0-4d1d-815e-03d40fbc4cc7","resolution":{"observed_at":"2026-08-01T20:38:57.042547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.145809Z","title":"Tag Trends Data Science Libraries,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.145809Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:f2e950ab71063bae7da5ea28cf612b93896c6796c9cade0e4d841c9d4f6b966c","observation_id":"23681fc4-7de1-4198-91a7-8ebdb21ed7ce","resolution":{"observed_at":"2026-08-01T20:38:57.145809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.240755Z","title":"What is the most efficient way of counting occurrences in pandas?","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.240755Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:94c3617353f9f590dce59f3d0f410632c5dc8dbf1a3c9d9c8aa1558bdb1f58db","observation_id":"cacac818-fa97-44fc-9508-9d42a93aa6e6","resolution":{"observed_at":"2026-08-01T20:38:57.240755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.299795Z","title":"Output logs from AutoCodeRover and ArchCode ,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.299795Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:07276ea2fd010b0e1cb20747fd89092986007268fddc3aaaa2793a552468e262","observation_id":"e8fdff6e-da35-4377-8292-91cc118e6840","resolution":{"observed_at":"2026-08-01T20:38:57.299795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.457301Z","title":"Autocoderover: Autonomous program improvement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.457301Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:2ce7420dbca8c6dc3d33c41784695e935f764bc60abc6b7277bd88db017acf68","observation_id":"931762d7-2687-468b-bb98-941bc666e30d","resolution":{"observed_at":"2026-08-01T20:38:57.457301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.586717Z","title":"Archcode: Incor- porating software requirements in code generation with large language 11 models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.586717Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:ac880ffdd7bc981e21edd28f1043adac1287f68d197e67561ef8f97ae52dea28","observation_id":"4d25fb0f-23be-4020-9005-d36d15991ad2","resolution":{"observed_at":"2026-08-01T20:38:57.586717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.699679Z","title":"ReprodGen Prompts,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.699679Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:eeee4be511c575e5cf6c7dfad60fd15c92c4b484bb4af611844fe8235de13c15","observation_id":"84d1835a-ea1a-405d-bf88-71146761950a","resolution":{"observed_at":"2026-08-01T20:38:57.699679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.737583Z","title":"Intermediate artifacts,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.737583Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:a87d94f5de03cb660adfe1922974656ae0c84967b8bf1195c88fb1db031da85f","observation_id":"4a772003-bf8b-437a-9077-a9722debf1b1","resolution":{"observed_at":"2026-08-01T20:38:57.737583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.769711Z","title":"Structured chain-of-thought prompting for code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.769711Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:f3f19b580eec90802442997b873dfb54253c72cab7b5bbb7a0e49cb1c704fe7d","observation_id":"5bbae38e-59ac-4931-be6b-9d3a3c46bbbc","resolution":{"observed_at":"2026-08-01T20:38:57.769711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.820241Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.820241Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:d5edb3326621e09331a98ef9e8577352c01e1a9f0021e0e31f1d7dc4294b1013","observation_id":"aef7d41c-17c0-43b0-a281-07995ad1c888","resolution":{"observed_at":"2026-08-01T20:38:57.820241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.896700Z","title":"On reliability of patch correctness assessment,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.896700Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:021eb596bd4e4678f3e8f41a956cde3338449d44d23d917953946df1d00b2499","observation_id":"423265e1-4278-4724-bfeb-d5aa0f728ff5","resolution":{"observed_at":"2026-08-01T20:38:57.896700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:57.962864Z","title":"Llm hallucinations in practical code generation: Phenomena, mechanism, and mitigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:57.962864Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:38ae4cd1baba9336afeaf0aba5a800f7f1263c902029962c4ad69c734f8f4c59","observation_id":"f475e1d1-504f-49b0-b9ac-9be74d0e4de5","resolution":{"observed_at":"2026-08-01T20:38:57.962864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.056051Z","title":"Ds patch gen query,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.056051Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:88cc8595fbf7ec1b9cc908cb9204b8032f7edeeb9e35dbfa2fb268d9a15c5c37","observation_id":"0dbd60a6-41ed-4f41-b4d9-d5695fb8b8c7","resolution":{"observed_at":"2026-08-01T20:38:58.056051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.098944Z","title":"Towards ai-assisted synthesis of verified dafny methods,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.098944Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:2fd86ac8514afe466a94a41aaaf6e352ce33d7784e4ce8a2c316a69a7fc9e4c4","observation_id":"03828dce-ea0b-42a3-b64e-a73827a81edd","resolution":{"observed_at":"2026-08-01T20:38:58.098944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.215028Z","title":"A comprehensive study on deep learning bug characteristics,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.215028Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:cb3c659bf7adb1b001069228287293d23a26aa9ec11815d38a0be9d59221741a","observation_id":"4bcd05fb-b035-49e2-888d-e92fe698e1cf","resolution":{"observed_at":"2026-08-01T20:38:58.215028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.357953Z","title":"The art and practice of data science pipelines: A comprehensive study of data science pipelines in theory, in-the-small, and in-the-large,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.357953Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:dfdae5f0943c1a055ed813e95b68101d11288cce9f121c4d591a3e0595d85ee2","observation_id":"3daf92f8-9db2-4120-b6b0-0f5c8e19820e","resolution":{"observed_at":"2026-08-01T20:38:58.357953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.477473Z","title":"Bigcode models leaderboard,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.477473Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:9d6f7c5b89c0e3b982bfe3ea3a71cdef0cb9ef5e54b1d2a314ad5f8d09c3f74e","observation_id":"49ecd25a-899f-41d5-ad08-4ccdb02c7e03","resolution":{"observed_at":"2026-08-01T20:38:58.477473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T20:38:58.551665Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.551665Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:055e1b0bd02108f9beb1bef5e74a71d00b93a1e7797a2ce2273542386ad7276c","observation_id":"4ea1952e-bfdc-48a9-b4d6-4c8bf869d6aa","resolution":{"observed_at":"2026-08-01T20:38:58.551665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-01T20:38:58.774747Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.774747Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:7ca7ff7eb9d60e595ac76ee470c5bd60c1e60e964822e6ddcfd297b502727c16","observation_id":"936b7e89-cf60-463e-9139-c376623c820a","resolution":{"observed_at":"2026-08-01T20:38:58.774747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:58.902627Z","title":"Llama 3: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.902627Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:f4cc8a47f0f929e2221caa8dd5ad6b2fa02c751c986439d2e27ed73970c04521","observation_id":"c435b79e-45cb-496a-82d3-fed828675a4c","resolution":{"observed_at":"2026-08-01T20:38:58.902627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-07T06:30:25.302107Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-01T20:38:58.963799Z","title":"Deepseek-coder-v2: Breaking the barrier of closed-source models in code intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:58.963799Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:fdb1ea4c6b1cea0c42104afd0e5ca33de601542b12a6388ba1cd32aeff44a5de","observation_id":"33003dfc-5152-489f-9bcb-0c8d63e7c98d","resolution":{"observed_at":"2026-08-01T20:38:58.963799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-01T20:38:59.254556Z","title":"Phi- 4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.254556Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:c0c515f98a1baeb5541e90d8fc00ea3a273e5fc24cc1f56fc431cd9f4a7b87cd","observation_id":"422a8c36-adc6-4b0b-9e1a-32cc912daf89","resolution":{"observed_at":"2026-08-01T20:38:59.254556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.406456Z","title":"Evaluating and improving chatgpt for unit test generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.406456Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:c9508150df8cf49a9aea48cafd02814064a58615fa232ca96f9b1bf2888bab14","observation_id":"0ba18a7b-e203-481a-8929-714ca70f00b8","resolution":{"observed_at":"2026-08-01T20:38:59.406456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.474684Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.474684Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:07aacc29578604d6e3d020b62a83c1a5432d30650d73c2fff467ea0173ff7b96","observation_id":"9f42ef89-7bf6-4e0d-a923-8761c82f2cc6","resolution":{"observed_at":"2026-08-01T20:38:59.474684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.547262Z","title":"CodeBERTScore: Evaluating code generation with pretrained models of code,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.547262Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:8b55537ce3bf3081dfa5f355c9b1913a8f533ca1f1032a3d2c20a69f4ad88308","observation_id":"c58ed821-6f0d-424a-a467-a05849cb90f2","resolution":{"observed_at":"2026-08-01T20:38:59.547262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.607346Z","title":"Accurate and efficient refactoring detection in commit history,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.607346Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:02958c36b30b8f63802e7ab9a5f734f3909a7323deab6fbb701397e3c42201bc","observation_id":"dea723ac-3a95-4475-b761-f303707598b9","resolution":{"observed_at":"2026-08-01T20:38:59.607346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.664620Z","title":"Binary codes capable of correcting deletions, inser- tions, and reversals,","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.664620Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:301fd3d818754e48691bbc2c705c091584ed7c39d323c81c236fa8f2b10cee03","observation_id":"2f73f4d1-e944-43d8-bf4e-9b9d5cb26549","resolution":{"observed_at":"2026-08-01T20:38:59.664620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.738903Z","title":"Towards Understanding the Characteristics of Code Generation Errors Made by Large Language Models ,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.738903Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:e6b98a46e8c36d87798ade385da3e9ad9c10c4e08e5b98b818971268fcccb020","observation_id":"20d17fc7-5497-4e43-8722-e787940ddfcb","resolution":{"observed_at":"2026-08-01T20:38:59.738903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.810606Z","title":"Can LLMs reason about program semantics? a comprehensive evaluation of LLMs on formal specification inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.810606Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:fb2cda145bbeab7b40bd0ce457497c3d522f0e8080d7bc2e402bde082e36f934","observation_id":"d268fd13-a913-4d00-a871-0b0779774ca5","resolution":{"observed_at":"2026-08-01T20:38:59.810606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.876993Z","title":"Hints help finding and fixing bugs differently in python and text-based program representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.876993Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:02be66e3447dda88a5fd1f9689ce484ab95080dfe483f31a01673acb88597014","observation_id":"e8fffa96-c86a-4c52-841d-d476a21e2ed5","resolution":{"observed_at":"2026-08-01T20:38:59.876993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:59.945666Z","title":"Imitation game: Reproduc- ing deep learning bugs leveraging an intelligent agent,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:59.945666Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:a8153dcdf1cd701326070d81c278c6b643b9fc78d5c015da0f01e689ffecb5c8","observation_id":"71af787a-57c8-4fda-9780-c0192cf59d78","resolution":{"observed_at":"2026-08-01T20:38:59.945666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.062426Z","title":"Zs4c: Zero-shot synthesis of compilable code for incomplete code snippets using llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.062426Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:731b6993552d17129f3032e90715f6ff176e325aa2959954591a4170e65521bb","observation_id":"ed282c0c-46a4-49e6-829e-3fc3a55b90b2","resolution":{"observed_at":"2026-08-01T20:39:00.062426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.147778Z","title":"Selfpico: Self-guided partial code execution with llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.147778Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:a1b25aa17b503f3758ce081cc780be97a621239927e4d89f6092cc01c2dcd230","observation_id":"da7d772a-3ad7-495e-b088-5ec36d6cf7a5","resolution":{"observed_at":"2026-08-01T20:39:00.147778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.224401Z","title":"Evaluating large language models in class-level code generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.224401Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:cdc84bd5f29a4b92a523b2e52bbee5bda80e33c40201d67510d17c00a5800bc3","observation_id":"2d7357ea-b16e-49ce-a389-3dd0faabd2ab","resolution":{"observed_at":"2026-08-01T20:39:00.224401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.264514Z","title":"Identifying patch correctness in test-based program repair,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.264514Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:0b7fb7dbbd8a694049bbf3f895c977aad5731918b257f7ddae24a3d2d5407349","observation_id":"58af5cb1-ab5c-4ef7-9ee5-1d0c49ad4d4d","resolution":{"observed_at":"2026-08-01T20:39:00.264514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.323748Z","title":"ReprodGen Repository,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.323748Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:e1f3c7f266df2af8e6a248df728076ceb9fe4a5c7e45e3bf3ad94a35bc25f0bd","observation_id":"e4cd068e-285a-4be0-86fe-50010ab3d885","resolution":{"observed_at":"2026-08-01T20:39:00.323748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.453850Z","title":"ReprodGen Bench,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.453850Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:000f94e50e4f561d42e7d94b88d8d8d5d2136f040a1b3404848383db26151868","observation_id":"9d903af3-b7b7-4f6b-919e-ab691bfc547f","resolution":{"observed_at":"2026-08-01T20:39:00.453850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:39:00.617619Z","title":"ReprodGen Leaderboard,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T20:39:00.617619Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:2860b4b840c76454be74209721b5745d0adc25ebc55423ffaa58939668fcbbd8","observation_id":"f1533079-2d44-45bf-bf9b-3f7471ff3ac0","resolution":{"observed_at":"2026-08-01T20:39:00.617619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:38:56.800567Z","title":"Available: https://doi.org/10.1145/3728963","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:56.800567Z"},"links":{"citing_paper":"/paper/2607.16569"},"observation_digest":"sha256:7e1bfa99676d97598d0abaa6c902e0326290b2d92503d22426d27370a8a23687","observation_id":"207b0dfe-636b-4a3e-bf36-a0dfea06520f","resolution":{"observed_at":"2026-08-01T20:38:56.800567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16569","last_updated":"2026-07-18T00:48:26Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-09T08:29:02.384410Z","submitted_at":"2026-07-18T00:48:26Z","title":"From Discussion to Execution: Replicating Buggy and Correct Data Science Code"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.16569."}