{"as_of":"2026-08-12T13:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64b39e9a59276dd64162b156ef2f7e9280e408ac8264c1cf04269136805d240f","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:52:50.638681Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.22768/citation-record","integrity":"/paper/2509.22768/integrity","json":"/paper/2509.22768/citation-record.json","paper":"/paper/2509.22768"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:45.456078Z","title":"MEGA : Multilingual evaluation of generative AI","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:45.456078Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:e9787bc49c38e803aaf8903a4e098040035100d503ff0ab91cd7cb6cac9fbb3e","observation_id":"e420ec97-8354-432d-a81f-1547a576a8ea","resolution":{"observed_at":"2026-08-04T14:52:45.456078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:45.542088Z","title":"Don’t push the button! exploring data leakage risks in machine learning and transfer learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:45.542088Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:9b9138cb8b66e706c1c64083c1ff4354373056be3dcf4b21a6cc575ed8272fbd","observation_id":"c4338902-d974-4a93-876b-1961c01736a7","resolution":{"observed_at":"2026-08-04T14:52:45.542088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:45.681840Z","title":"Do, Yan Xu, and Pascale Fung","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:45.681840Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:4b2cf1602f34b5f4b75bd2567a8c6648e93603693561e7c6c7d414afd10baca5","observation_id":"fda118ab-8731-4786-9027-99de33468a22","resolution":{"observed_at":"2026-08-04T14:52:45.681840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:45.852056Z","title":"MLE -bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:45.852056Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:abeff70816628344de7cf5ae588322f32eb34153227b27da67a8667f1ced8968","observation_id":"dca7e741-24e2-4292-9f0e-f13a89578fa3","resolution":{"observed_at":"2026-08-04T14:52:45.852056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T14:52:45.983121Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:45.983121Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:35820a2ed2a25cc93b89e08f6f1af3553a19a19317df07c0878bbdc63fe9afff","observation_id":"10b37b62-bc47-488b-9a0e-fce59ebf2109","resolution":{"observed_at":"2026-08-04T14:52:45.983121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:46.093206Z","title":"R o C ode: A dataset for measuring code intelligence from problem definitions in R omanian","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.093206Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:93205c4d8901a9d996baf85e87342e1e78cf089c0dfc9085a94ce433499d7e37","observation_id":"a45a150c-1add-4c85-82db-133695def190","resolution":{"observed_at":"2026-08-04T14:52:46.093206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16073","last_updated":"2024-08-06T12:32:15Z","snapshot_observed_at":"2026-08-09T00:09:53.550145Z","submitted_at":"2022-11-29T10:30:40Z","title":"Abstract Interpretation-Based Data Leakage Static Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.16073","snapshot_observed_at":"2026-08-04T14:52:46.250742Z","title":"Abstract interpretation-based data leakage static analysis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.250742Z"},"links":{"cited_paper":"/paper/2211.16073","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:21c7d0d20a9b58ddf117be13906a1b792ffa7b3536bd2a138d70f4ee8cacac5e","observation_id":"425917cb-f6cb-41aa-8a6e-6738841ed173","resolution":{"observed_at":"2026-08-04T14:52:46.250742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:46.373728Z","title":"Code4ml: a large-scale dataset of annotated machine learning code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.373728Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:9296903baf9ead5fe66b4aa03d0c0d60b19a47b9d87b2e7384487a2da473b9eb","observation_id":"39787f77-bd8c-43c9-9bcf-20c0f0673a44","resolution":{"observed_at":"2026-08-04T14:52:46.373728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:46.445465Z","title":"Neural architecture search: A survey","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.445465Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:08987f245e4cd8772b62ed77685f8a8f1503b8540ad3b8dc637792109617be41","observation_id":"f4603158-7b91-40af-9387-07492a75bb3d","resolution":{"observed_at":"2026-08-04T14:52:46.445465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:46.648892Z","title":"Efficient and robust automated machine learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.648892Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:ccdda1ce04a546f752256b596fdf713f616b7bd8feca80eae4641c4fa421d3a0","observation_id":"06e7f6d6-bf49-4634-9cae-cf4c12d5ebb3","resolution":{"observed_at":"2026-08-04T14:52:46.648892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09210","last_updated":"2023-02-18T02:11:36Z","snapshot_observed_at":"2026-08-09T14:17:01.779895Z","submitted_at":"2023-02-18T02:11:36Z","title":"How Good Are GPT Models at Machine Translation? A Comprehensive Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09210","snapshot_observed_at":"2026-08-04T14:52:46.813328Z","title":"How good are gpt models at machine translation? a comprehensive evaluation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.813328Z"},"links":{"cited_paper":"/paper/2302.09210","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:5c7dc00806074a44753249580eb55d533c888906f92cc09d93ede4fbc8111546","observation_id":"cdd74d53-5673-4387-b47e-707c26cb6546","resolution":{"observed_at":"2026-08-04T14:52:46.813328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:46.924451Z","title":"DA -code: Agent data science code generation benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:46.924451Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:b255b206304bed59b4a98f3da12f53cf7ba3d453ca82972ac8bdd81488449ae6","observation_id":"64d76b61-f079-48b1-a95a-190502e4a1bc","resolution":{"observed_at":"2026-08-04T14:52:46.924451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09436","last_updated":"2020-06-08T09:09:28Z","snapshot_observed_at":"2026-08-06T10:54:14.530969Z","submitted_at":"2019-09-20T11:52:45Z","title":"CodeSearchNet Challenge: Evaluating the State of Semantic Code Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09436","snapshot_observed_at":"2026-08-04T14:52:47.012365Z","title":"Codesearchnet challenge: Evaluating the state of semantic code search","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.012365Z"},"links":{"cited_paper":"/paper/1909.09436","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:3f1a342e5ecfeeda40946390c1d4e0c9ad693be31ff4f6fd204b4d3925808a86","observation_id":"a5f330a1-39c7-4150-82bd-85682835644d","resolution":{"observed_at":"2026-08-04T14:52:47.012365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13138","last_updated":"2025-02-18T18:57:21Z","snapshot_observed_at":"2026-08-05T07:03:00.655237Z","submitted_at":"2025-02-18T18:57:21Z","title":"AIDE: AI-Driven Exploration in the Space of Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13138","snapshot_observed_at":"2026-08-04T14:52:47.132960Z","title":"Aide: Ai-driven exploration in the space of code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.132960Z"},"links":{"cited_paper":"/paper/2502.13138","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:a5126386d9cb3e252eca485889d551d6465615e5c2e6f26096faa280f9a4f901","observation_id":"d35eff5a-5cfa-4009-bc98-c4dad0339ada","resolution":{"observed_at":"2026-08-04T14:52:47.132960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08745","last_updated":"2023-11-02T07:19:37Z","snapshot_observed_at":"2026-08-10T10:18:18.039252Z","submitted_at":"2023-01-20T08:51:36Z","title":"Is ChatGPT A Good Translator? Yes With GPT-4 As The Engine","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08745","snapshot_observed_at":"2026-08-04T14:52:47.365507Z","title":"Is chatgpt a good translator? yes with gpt-4 as the engine, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.365507Z"},"links":{"cited_paper":"/paper/2301.08745","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:ff8a1a2b234a540365560f9c07f80c2fb6158f4541b9e2da696baa2b705b19b4","observation_id":"67fa34a3-6f01-4847-9cac-5ac1b1c4e261","resolution":{"observed_at":"2026-08-04T14:52:47.365507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:47.579659Z","title":"Better to ask in english: Cross-lingual evaluation of large language models for healthcare queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.579659Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:73f1b721c3ae086eed8bf663a4aaa9f96f501407fcc81427ce9ce44e09894b7b","observation_id":"52378ff4-98e4-4e66-95d1-24e301beb581","resolution":{"observed_at":"2026-08-04T14:52:47.579659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:47.761260Z","title":"Leakage and the reproducibility crisis in machine-learning-based science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.761260Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:8d0d4c910b1f19e9e88916c3e2897a7f55078c0660fd758863695f96490abfca","observation_id":"ad604c15-4f00-481d-a0ba-c1830dfb1ad1","resolution":{"observed_at":"2026-08-04T14:52:47.761260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:47.897537Z","title":"Ds-1000: a natural and reliable benchmark for data science code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.897537Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:4672055e37c052bb5fe7ebf2ab6c64ffb82133ea4d2306b767bf9b373d17de88","observation_id":"91e5a2f4-be41-4d93-9f6c-8bad564ac27e","resolution":{"observed_at":"2026-08-04T14:52:47.897537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:47.995256Z","title":"H2o automl: Scalable automatic machine learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:47.995256Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:4bfa3a57a291fa0326c569eccfc2c28491b8053b47b41f1b9c8be52ec9494323","observation_id":"a4eb0139-5aa9-4a31-b3ab-889cb471791b","resolution":{"observed_at":"2026-08-04T14:52:47.995256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09701","last_updated":"2025-05-09T18:19:23Z","snapshot_observed_at":"2026-08-10T21:31:45.932628Z","submitted_at":"2024-08-19T05:11:46Z","title":"Bridging the Language Gap: Enhancing Multilingual Prompt-Based Code Generation in LLMs via Zero-Shot Cross-Lingual Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09701","snapshot_observed_at":"2026-08-04T14:52:48.068875Z","title":"Bridging the language gap: Enhancing multilingual prompt-based code generation in llms via zero-shot cross-lingual transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.068875Z"},"links":{"cited_paper":"/paper/2408.09701","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:2490cb34028a221eb5a04633491109c12995bdd127c7104dc1776e1d71659e58","observation_id":"a4d37812-aefe-45e9-98a7-5c376415acb8","resolution":{"observed_at":"2026-08-04T14:52:48.068875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-04T14:52:48.179470Z","title":"Starcoder: may the source be with you! arXiv preprint arXiv:2305.06161, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.179470Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:d28f7a2a2f32422b7b8221211301579443d1f9ad4fa0f11b1ccfc5957e4ec9ec","observation_id":"d4a1793e-a95c-4941-a3a7-2bb8a7f54953","resolution":{"observed_at":"2026-08-04T14:52:48.179470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:48.326957Z","title":"DARTS : Differentiable architecture search","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.326957Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:5a968a14437b36e458cd628d16266a896ef0ddd69f7c9cd0d4d027257399570e","observation_id":"6bfeca5d-667a-4960-8f82-747f5eb2a5a2","resolution":{"observed_at":"2026-08-04T14:52:48.326957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07565","last_updated":"2024-10-03T16:48:55Z","snapshot_observed_at":"2026-08-12T08:20:36.236552Z","submitted_at":"2024-07-10T11:50:20Z","title":"On Leakage of Code Generation Evaluation Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07565","snapshot_observed_at":"2026-08-04T14:52:48.436986Z","title":"On leakage of code generation evaluation datasets, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.436986Z"},"links":{"cited_paper":"/paper/2407.07565","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:ca27b165fa7ba2766f13f6186c52c100efa3de4fb5b75e88b631dd63aac968ae","observation_id":"aee95852-047f-4726-848b-90c4e94a2711","resolution":{"observed_at":"2026-08-04T14:52:48.436986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:48.607551Z","title":"Evaluating programming language confusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.607551Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:e89276525d1fbcfc427aacf3677423dbb311d830515901ad33e09f300b97f282","observation_id":"bc99bfad-adb8-401d-99c3-edd33fc5aef6","resolution":{"observed_at":"2026-08-04T14:52:48.607551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:48.698716Z","title":"Crosslingual generalization through multitask finetuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.698716Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:b4473671b0f1409d7ac4361c3f1b0037bd2a65eba23e80b5ed6c680c35e7885d","observation_id":"9f7c6e13-9f1b-40f0-bdf6-d2d5f498f3a1","resolution":{"observed_at":"2026-08-04T14:52:48.698716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:48.870432Z","title":"Olson, Nathan Bartley, Ryan J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:48.870432Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:717f82f9aafd9e90bde623e5ef19c7539f63125cfaa666ffac29814db642158e","observation_id":"f0c9f926-3437-4da0-a311-d138b1341510","resolution":{"observed_at":"2026-08-04T14:52:48.870432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.054155Z","title":"Dscodebench: A realistic benchmark for data science code generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.054155Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:0cc02433e870c1b5c22af4e32773e1863d8b6cd19fe3743d1a62743f55bd2257","observation_id":"243d93b9-8f3d-4874-9e8c-97848239dccd","resolution":{"observed_at":"2026-08-04T14:52:49.054155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.202574Z","title":"Efficient neural architecture search via parameters sharing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.202574Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:e5fc88d279ade73d1d2b8a67151f941b8fd07e9500a664ded7f7b0d3bf9071e2","observation_id":"59e74f38-68e8-484c-b5ff-0a7d8079fcc3","resolution":{"observed_at":"2026-08-04T14:52:49.202574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.284097Z","title":"Meta kaggle code, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.284097Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:2fe5752a19b2aae50cf5e142b173bb327e9315628e5da7d10af4386eb03c7d0a","observation_id":"936bb467-1a9a-4eeb-851c-286e5ddfbb1a","resolution":{"observed_at":"2026-08-04T14:52:49.284097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.398954Z","title":"m H uman E val - a multilingual benchmark to evaluate large language models for code generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.398954Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:a84663ff07792450d56858febdf35452bf1cd4a9677887b7f7fab461fa9f145c","observation_id":"4a33406c-9442-49cb-8bf8-8d48daa9312e","resolution":{"observed_at":"2026-08-04T14:52:49.398954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16806","last_updated":"2023-06-06T03:15:43Z","snapshot_observed_at":"2026-08-10T07:02:56.357906Z","submitted_at":"2023-05-26T10:38:31Z","title":"Do GPTs Produce Less Literal Translations?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16806","snapshot_observed_at":"2026-08-04T14:52:49.483019Z","title":"Do gpts produce less literal translations?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.483019Z"},"links":{"cited_paper":"/paper/2305.16806","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:6000499f91cb22381df0b9f74796c846550e9893b93364ad170d82a5a070b297","observation_id":"3f05b8c5-4f13-46ec-b7c1-fe72e521d0d3","resolution":{"observed_at":"2026-08-04T14:52:49.483019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-04T14:52:49.569202Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.569202Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:fa934aba75cbd50ce6de13445e9ddec0845e8d4e0072baf8307201074764a7ae","observation_id":"65082097-3b06-4b20-8026-2dbca25f9768","resolution":{"observed_at":"2026-08-04T14:52:49.569202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.671243Z","title":"Sasse, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.671243Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:1127e1dcbb72c718f7e9f729f4ae3e7b096770340f357c800b49512f5d34aa6f","observation_id":"c6db1d1c-91fa-49b1-8832-53d5913799c8","resolution":{"observed_at":"2026-08-04T14:52:49.671243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:49.760663Z","title":"Biocoder: a benchmark for bioinformatics code generation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.760663Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:bc4bf1dafda9283bad90118551d2ba009797514d672367eacaf0e33efe1bd3b7","observation_id":"d57d06e2-b08b-40d7-a4fd-2a0050e7339b","resolution":{"observed_at":"2026-08-04T14:52:49.760663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13168","last_updated":"2024-07-18T05:15:24Z","snapshot_observed_at":"2026-07-06T18:48:12.383629Z","submitted_at":"2024-07-18T05:15:24Z","title":"SciCode: A Research Coding Benchmark Curated by Scientists","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13168","snapshot_observed_at":"2026-08-04T14:52:49.846361Z","title":"Scicode: A research coding benchmark curated by scientists","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.846361Z"},"links":{"cited_paper":"/paper/2407.13168","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:cf3883e29629291173810f45d6d7d38479356ca06b25c69d5fe8e836c0b95eb0","observation_id":"c6c3e951-9187-446f-8974-1a3d1d2f5592","resolution":{"observed_at":"2026-08-04T14:52:49.846361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01528","last_updated":"2022-04-05T13:45:00Z","snapshot_observed_at":"2026-08-09T13:14:55.508289Z","submitted_at":"2021-09-03T13:52:32Z","title":"LightAutoML: AutoML Solution for a Large Financial Services Ecosystem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01528","snapshot_observed_at":"2026-08-04T14:52:49.910664Z","title":"Lightautoml: Automl solution for a large financial services ecosystem, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.910664Z"},"links":{"cited_paper":"/paper/2109.01528","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:e43b8e73085ee953d25c44ebc8ec2fd6c662a8665c07633da13be98aebe636a4","observation_id":"da2f3360-d57d-4ea2-b2bf-ee6767351e45","resolution":{"observed_at":"2026-08-04T14:52:49.910664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-02T14:58:44.167588Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-04T14:52:49.994121Z","title":"Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, Hoang H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:49.994121Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:397e2f8494ed21e09dcff4e5a48a656063a14fc72a12126f52078b08d2c16a35","observation_id":"326cfc55-677f-4256-a3a3-b34b38dc4559","resolution":{"observed_at":"2026-08-04T14:52:49.994121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08388","last_updated":"2023-02-07T03:12:50Z","snapshot_observed_at":"2026-08-01T15:13:33.142086Z","submitted_at":"2022-03-16T04:21:50Z","title":"MCoNaLa: A Benchmark for Code Generation from Multiple Natural Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08388","snapshot_observed_at":"2026-08-04T14:52:50.080171Z","title":"Mconala: A benchmark for code generation from multiple natural languages","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.080171Z"},"links":{"cited_paper":"/paper/2203.08388","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:13dbbe5bab954899571b49b186dca64060a5fb1a310c0593c7583dd3fe17fc81","observation_id":"0373be4a-3c79-484c-9b03-7ede74aba817","resolution":{"observed_at":"2026-08-04T14:52:50.080171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03345","last_updated":"2022-09-07T17:59:42Z","snapshot_observed_at":"2026-08-05T14:54:46.959481Z","submitted_at":"2022-09-07T17:59:42Z","title":"Data Leakage in Notebooks: Static Detection and Better Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03345","snapshot_observed_at":"2026-08-04T14:52:50.160601Z","title":"Lewis, and Christian Kästner","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.160601Z"},"links":{"cited_paper":"/paper/2209.03345","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:a373c9a64dc98e734c80ccbde06d2cbf3f51a22e1601007a3900f6619d635b5b","observation_id":"3606950e-8203-4733-bc79-7f5e90003c6f","resolution":{"observed_at":"2026-08-04T14:52:50.160601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06215","last_updated":"2025-02-10T07:33:49Z","snapshot_observed_at":"2026-08-12T09:40:08.387624Z","submitted_at":"2025-02-10T07:33:49Z","title":"LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06215","snapshot_observed_at":"2026-08-04T14:52:50.211290Z","title":"Lessleak-bench: A first investigation of data leakage in llms across 83 software engineering benchmarks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.211290Z"},"links":{"cited_paper":"/paper/2502.06215","citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:11ec7c5ea5e997ed6d4de0556a2aefcf1cc1217f40205805066e89fd21b5fd95","observation_id":"454558da-8267-4e9d-ada2-7797949bcc52","resolution":{"observed_at":"2026-08-04T14:52:50.211290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.11854","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Journal of Artificial Intelligence Research","work_id":"e3f90a6c-1234-4175-b0e1-4859a69d3e8c","year":2021},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.314164Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:0447adb0fa76c3cfe677132c5c5f7cff53deb49f643811ced4a9f795cc98d78d","observation_id":"47f62696-d9f4-4954-9b87-f220d173af03","resolution":{"observed_at":"2026-08-04T14:53:21.126268Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:50.383648Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.383648Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:5067f3a2cd45148f2fe6b05140eda77d370e37574217835bbb138c5d90b47b03","observation_id":"f4f7e8e6-5ff7-4d32-ba10-0a1256f3afdd","resolution":{"observed_at":"2026-08-04T14:52:50.383648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:50.475733Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.475733Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:5026ab14f3dcfd5959983335e8b1708cf98da44acb801e1c498cef66e3879d71","observation_id":"fcd9988c-2c0a-4aba-9cbc-28b12ce13d36","resolution":{"observed_at":"2026-08-04T14:52:50.475733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:50.558496Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.558496Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:274e77fedaf664d83526887824ef0131f7f31d1694caee9615adeeca2e6f4421","observation_id":"3977f7a0-e450-451e-aab6-3c1c6756bf8f","resolution":{"observed_at":"2026-08-04T14:52:50.558496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:50.638681Z","title":"9rD= <8rrr, 5jTXyyy5V ꬦM`0HΞ=[X5Z ꬀[t ߿XܹSԮ];i qsv Ÿu9 >|Xo =z(00PΝ n: UVzǝ]2Z 4 ڸqV 6c4j(] rR g ǎiJHH=--M + P u5k, iӦ . egg+::Z /VLL ] 3Fwy P uӧ-` (WWW+","venue":null,"work_id":null,"year":1920},"citing_paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T14:52:50.638681Z"},"links":{"citing_paper":"/paper/2509.22768"},"observation_digest":"sha256:9e37ae6f3ac626a4e39a42bae04147a01838d6bad7a05db2eb57c4b32140a0a0","observation_id":"1570824f-2e9a-4fab-9e0c-7eb165238048","resolution":{"observed_at":"2026-08-04T14:52:50.638681Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.22768","last_updated":"2026-07-28T18:10:53Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T11:46:00.640407Z","submitted_at":"2025-09-26T17:20:27Z","title":"ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2509.22768."}