{"as_of":"2026-08-13T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6f7d0342dd24a4877f62b0b35f8da69fb0a88ce84240806bcb1342eebe504d8","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:42:09.599158Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T08:40:40.910461Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T08:40:41.692714Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"cited_work":{"arxiv_id":"2506.13824","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13824","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mldebugging: Towards benchmarking code debugging across multi-library scenarios","venue":null,"work_id":"af57d278-cdd0-4344-8212-02b556ee575e","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":292,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2506.13824","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:ca77e12eb14121f77c78e04cb79fcf4684483b6e1a2a2442c09b758e06163b10","observation_id":"07286c01-01f8-439f-ba59-62de7c4b9d7c","resolution":{"observed_at":"2026-05-12T08:40:41.695413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13824/citation-record","integrity":"/paper/2506.13824/integrity","json":"/paper/2506.13824/citation-record.json","paper":"/paper/2506.13824"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.396515Z","title":null,"venue":null,"work_id":"90bb39f8-b435-4fe9-be33-941548293e11","year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.463251Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:71593492cae0f2cef737af7185fc4087de0967d286da40def5b081881331516f","observation_id":"0c040177-3bd8-4dba-95bf-be1aae121292","resolution":{"observed_at":"2026-08-07T00:42:10.399321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.386543Z","title":null,"venue":null,"work_id":"18c93a91-cb98-40b5-ad55-6d25e5212b5b","year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.467355Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:32faaf1f534dafcccb7d867c3f2cc050604e9fc380bf9cf7a032260b1f83e57d","observation_id":"4e00c639-6efd-40fc-b0fc-dda8870d07c4","resolution":{"observed_at":"2026-08-07T00:42:10.390245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T00:42:09.470671Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.470671Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:f05bc750b25811ebde210b9a1d9c645cfe6f8054a993449608a5621c05c76120","observation_id":"b6ec5a14-83a9-4b4a-bf92-90c5ac09ff99","resolution":{"observed_at":"2026-08-07T00:42:09.470671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.377811Z","title":null,"venue":null,"work_id":"3610e493-c891-4b28-9936-d3a7b1a17a75","year":2021},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.476080Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:31629d15791cd98a2bb9c9011927f6f62f74b250d387fe063004a4f839155d75","observation_id":"333d65df-2191-454d-9be4-2fc601ed451b","resolution":{"observed_at":"2026-08-07T00:42:10.380828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T00:42:09.478934Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.478934Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:0ee4f639d83cd8dee5df36c15f69b40bda604e29b73893b784696709f2544e2b","observation_id":"33942924-3bb3-401c-a3ba-be80b138a9f7","resolution":{"observed_at":"2026-08-07T00:42:09.478934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-07T00:42:09.482061Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.482061Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:a1bf66c653d3f18a8defd95ed65e8e2d2b637015105128652070b54f52c922cf","observation_id":"b3bbb7af-cb91-427f-b79f-3f58b2c36021","resolution":{"observed_at":"2026-08-07T00:42:09.482061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:09.485232Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.485232Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:7c05644bf0c6da48ac37d4281e1776963017b60e7c20be5f9bccd6feb0ca8f22","observation_id":"1519adbd-733e-4373-931d-ff0b76428d3c","resolution":{"observed_at":"2026-08-07T00:42:09.485232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:09.487844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.487844Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:db1518345c32799f128b2af16d9c709c201abacfa72ae7db47ea87ad2507b26c","observation_id":"792e4be0-64ce-4a0a-b820-151f20cf10f4","resolution":{"observed_at":"2026-08-07T00:42:09.487844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.362227Z","title":null,"venue":null,"work_id":"d31bb595-101a-48ea-8002-1f8c518d4b4e","year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.490599Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:694a67426a665990aa3709ec98ebed573c05086f43bb6178c81a3c85864d236c","observation_id":"35e728e7-1806-4abd-a746-187736088b1d","resolution":{"observed_at":"2026-08-07T00:42:10.364984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00711","last_updated":"2025-05-05T13:57:12Z","snapshot_observed_at":"2026-08-07T16:17:39.513446Z","submitted_at":"2025-04-01T12:21:50Z","title":"GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00711","snapshot_observed_at":"2026-08-07T00:42:09.493555Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.493555Z"},"links":{"cited_paper":"/paper/2504.00711","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:782077de0f0c2298d9f14235ae3ab93163fc060640fef2a5b1230f61f7531f57","observation_id":"d587595b-6623-46e3-8cbd-efdb847a516c","resolution":{"observed_at":"2026-08-07T00:42:09.493555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11125","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.118059Z","title":null,"venue":null,"work_id":"86824bf1-4689-4bcd-b3e6-58d35cbb7d71","year":2025},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.497115Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:983b4be2568cf1e69bf84e847e757e29fcbc54b15a5ca216d274e89bef3ad08b","observation_id":"745a1b1d-224a-4703-a7b6-b744e61b7432","resolution":{"observed_at":"2026-08-07T00:42:10.122972Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.352480Z","title":null,"venue":null,"work_id":"9e6a0c77-f753-4372-b4da-f31bc84d3c26","year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.499612Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:53111298c409dc71af71faf94bf16b270a245583fb5039fc001639e0c2817a4b","observation_id":"c5b15406-6819-44a2-9765-897706a458e4","resolution":{"observed_at":"2026-08-07T00:42:10.355418Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02764","last_updated":"2025-02-26T16:52:21Z","snapshot_observed_at":"2026-08-13T08:56:42.127396Z","submitted_at":"2024-12-03T19:05:37Z","title":"Drawing Pandas: A Benchmark for LLMs in Generating Plotting Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02764","snapshot_observed_at":"2026-08-07T00:42:09.502274Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.502274Z"},"links":{"cited_paper":"/paper/2412.02764","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:628bffdf950d42196d7a439b172d82c2557bfb62da86af21e80f9071ecfb3927","observation_id":"44978140-8e11-45f5-8954-b165103bdd0c","resolution":{"observed_at":"2026-08-07T00:42:09.502274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:42:09.505190Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.505190Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:dec9ab5cc8551714deb556c3f32675a104e34e935133e07e0f3141ec7bb6ce0c","observation_id":"226b115d-8704-47e3-9e1c-95a41eeb0ef7","resolution":{"observed_at":"2026-08-07T00:42:09.505190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.342987Z","title":null,"venue":null,"work_id":"647cac55-e3a9-4f95-a500-0a872ada9b75","year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.508288Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:e11551fc9ba8b62d7ff07fcc64033247206cd763b7aae18173a6637766c29924","observation_id":"d72d98ae-2a77-4a79-bef2-88e425dc8679","resolution":{"observed_at":"2026-08-07T00:42:10.346776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T00:42:09.511034Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.511034Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:af1ceb817368d711d37c956b60c25a1649737a4b787e46782560b03c6ff6e67e","observation_id":"b429c8ab-adbf-4dc2-a1a0-46830cfbc8ca","resolution":{"observed_at":"2026-08-07T00:42:09.511034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T00:42:09.513489Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.513489Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:64d9e4b699c96e691afc661dfb3a75d313b1becbf83abf8350ca5fa05d8c99af","observation_id":"67c5ba8b-2dd5-46b0-8c9a-d457055f4fd2","resolution":{"observed_at":"2026-08-07T00:42:09.513489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T00:42:09.516406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.516406Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:817ec7219d21985185a53616df6e377b9df692be18346c950105e7052a8386e8","observation_id":"9f3c1913-a3a8-4d0b-929a-9eabe152a4e6","resolution":{"observed_at":"2026-08-07T00:42:09.516406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.334111Z","title":null,"venue":null,"work_id":"77e87ff7-d680-45c1-b4a7-6e94d2dc8bfa","year":2014},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.519685Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:dae2d475fd20d898cb59406539645fc2c6e4ff00f25026e08e46ab7221d3ad97","observation_id":"54deeabf-6fc1-4500-b74d-9f9975a75b43","resolution":{"observed_at":"2026-08-07T00:42:10.337104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:09.522623Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.522623Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:bf118a5d945490b9aa890355b023a414bfe08b375eb151fc93cb3c32554d6f8b","observation_id":"6a8c0e4d-cb07-4d5d-b3b0-f8cdb4800879","resolution":{"observed_at":"2026-08-07T00:42:09.522623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:09.525271Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.525271Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:5d02f822542f08b387f01f08d71cf15bc28d69a7f3adbe78a166e164c2c0d694","observation_id":"3a290be5-e2f7-4227-a6a1-4dad1b8fbc00","resolution":{"observed_at":"2026-08-07T00:42:09.525271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.310694Z","title":null,"venue":null,"work_id":"5b5992b5-cb7c-49f3-8575-a4c9fb4b474b","year":2025},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.527983Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:6d44b5efd4637ebf894af3db7b7b91f3e97f08a59d53adfa319b8693f31935f7","observation_id":"9c8576e9-1310-4090-a8a7-a423c537cf91","resolution":{"observed_at":"2026-08-07T00:42:10.313666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04329","last_updated":"2024-11-12T19:37:20Z","snapshot_observed_at":"2026-08-12T22:06:05.357599Z","submitted_at":"2024-11-07T00:09:54Z","title":"CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04329","snapshot_observed_at":"2026-08-07T00:42:09.530511Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.530511Z"},"links":{"cited_paper":"/paper/2411.04329","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:0579cf603f390b0be45402b3c7639d3bef90a4de55113fd2b674494658c96bfd","observation_id":"ed9b9f76-d081-47be-bfe5-c58d17aa5a67","resolution":{"observed_at":"2026-08-07T00:42:09.530511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.299885Z","title":null,"venue":null,"work_id":"6d56961d-63f7-4568-9a27-641ed89a1959","year":2017},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.533586Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:c48567638b2dbe81a84b8da9f7aa2910e29017112614d6d8c75957c82aa51848","observation_id":"652f14e1-77b9-408d-bb7e-482d7c4a1bc2","resolution":{"observed_at":"2026-08-07T00:42:10.303149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:42:09.536144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.536144Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:759833a585aa84f0ce9a74b1ce57c015554e663b9ffbe9fe0923ac5909deed22","observation_id":"5f431149-58e2-484f-9a70-ebcd611001f8","resolution":{"observed_at":"2026-08-07T00:42:09.536144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02310","last_updated":"2025-02-24T09:25:51Z","snapshot_observed_at":"2026-08-12T22:08:03.032391Z","submitted_at":"2024-11-04T17:36:40Z","title":"MdEval: Massively Multilingual Code Debugging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02310","snapshot_observed_at":"2026-08-07T00:42:09.538818Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.538818Z"},"links":{"cited_paper":"/paper/2411.02310","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:64b011c927fb47b92b686377d50706bc45b953303e0ecf58b5a398d91dec0251","observation_id":"c0abe823-b71e-4e49-b272-1c1cf19e9f60","resolution":{"observed_at":"2026-08-07T00:42:09.538818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.290060Z","title":null,"venue":null,"work_id":"7351a974-dacc-4500-a1a6-dab9384c8a54","year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.541848Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:766254cb5182fc18646360a62849854c36e94a5f9100b96aa909d6ea1c8a0bba","observation_id":"db108f5f-18b8-4a8d-878f-2f8f86bb6269","resolution":{"observed_at":"2026-08-07T00:42:10.293196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.280201Z","title":null,"venue":null,"work_id":"9cea3db5-5466-4a2e-b3d3-14680939ac56","year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.544740Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:66526a87e5b565ac1fdb6dbc5c02b29551ba8e24ca7c273f79a5e5a539fe15ba","observation_id":"e675ff88-41e1-4575-9a6d-4acbc0f19610","resolution":{"observed_at":"2026-08-07T00:42:10.283103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01102","last_updated":"2023-04-03T16:02:00Z","snapshot_observed_at":"2026-08-13T16:27:41.089701Z","submitted_at":"2023-04-03T16:02:00Z","title":"RunBugRun -- An Executable Dataset for Automated Program Repair","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01102","snapshot_observed_at":"2026-08-07T00:42:09.547445Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.547445Z"},"links":{"cited_paper":"/paper/2304.01102","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:2b8b419b972ae26717b951aba7c9606cfd5b997d93be8c36274cc5707df6d607","observation_id":"82e31ee1-6b05-4035-85ea-514fa82e6980","resolution":{"observed_at":"2026-08-07T00:42:09.547445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12819","last_updated":"2025-08-25T02:35:43Z","snapshot_observed_at":"2026-08-13T00:02:56.561615Z","submitted_at":"2024-05-21T14:24:01Z","title":"Large Language Models Meet NLP: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12819","snapshot_observed_at":"2026-08-07T00:42:09.550384Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.550384Z"},"links":{"cited_paper":"/paper/2405.12819","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:2274184381214a24afa1a3525e15d4ba793ed433dbbbdcffc069e74dab1a054f","observation_id":"96a7e48e-f2c5-4204-89ef-f57c109138f4","resolution":{"observed_at":"2026-08-07T00:42:09.550384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14799","last_updated":"2023-10-23T10:56:03Z","snapshot_observed_at":"2026-08-13T05:43:15.029044Z","submitted_at":"2023-10-23T10:56:03Z","title":"Cross-lingual Prompting: Improving Zero-shot Chain-of-Thought Reasoning across Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14799","snapshot_observed_at":"2026-08-07T00:42:09.553180Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.553180Z"},"links":{"cited_paper":"/paper/2310.14799","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:8bb2f244a91dc9e28923e35297ac0cc6ebea1b0c4457a8d9be421a96628e0b10","observation_id":"c70a98ce-3871-46aa-88fb-901e50367a14","resolution":{"observed_at":"2026-08-07T00:42:09.553180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:09.556531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.556531Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:61992b3d1594356165309a5f83e148608393fef25702b068a5c8db51941c255f","observation_id":"db96776b-a756-4232-9f45-4be7962526a3","resolution":{"observed_at":"2026-08-07T00:42:09.556531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T00:42:09.561561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.561561Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:dc72454c98ca0837198e2d243a2f2c7d05559b014e19f5cac2e6b5fc2a5c0bb4","observation_id":"c9f14ee7-f75d-4c76-bbb9-fe338a1846cf","resolution":{"observed_at":"2026-08-07T00:42:09.561561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.270596Z","title":null,"venue":null,"work_id":"df29dbca-0355-4191-ac6b-f38c2cf2bac4","year":2025},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.564360Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:01e99f6a99c4cf1199348c7b65b590007dc12ea0f31fbb954aff5d74f6bf8c49","observation_id":"e536bd6e-2458-4c88-9cd0-a8c10eadca3f","resolution":{"observed_at":"2026-08-07T00:42:10.273642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:10.261921Z","title":null,"venue":null,"work_id":"1dd4f88c-dd63-4f75-9553-916b9aadde0a","year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.567321Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:7420176567bedc2675803b30558ca82935d6110aca4d2563ba8f70d71aef8717","observation_id":"2fdd8ec8-0753-44e7-984d-cadb81de7804","resolution":{"observed_at":"2026-08-07T00:42:10.264633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04621","last_updated":"2024-06-06T06:10:00Z","snapshot_observed_at":"2026-08-13T04:45:52.753371Z","submitted_at":"2024-01-09T15:46:38Z","title":"DebugBench: Evaluating Debugging Capability of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04621","snapshot_observed_at":"2026-08-07T00:42:09.570013Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.570013Z"},"links":{"cited_paper":"/paper/2401.04621","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:a662476a048fef8e7a49adb5effeaa2a7ba151c47f086b7acfaed3b01dd95a7d","observation_id":"d471cea4-e9f8-4cc0-9da7-acec310c2be8","resolution":{"observed_at":"2026-08-07T00:42:09.570013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:09.573162Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.573162Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:3a2ccbea0644783c8bb2b7b1532a44cab73484d124f1a7f95769d41b0ba92977","observation_id":"29d844b2-b789-4973-8c95-8bb843740ffc","resolution":{"observed_at":"2026-08-07T00:42:09.573162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-07T00:42:09.575623Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.575623Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:b12b6a1d4d90198cfa0eacebc2944d4ec3499ac15ed19eb8fa7756c7beb72a18","observation_id":"cbccd861-4a65-481d-810a-bad7e28dbc3a","resolution":{"observed_at":"2026-08-07T00:42:09.575623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:42:09.578460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.578460Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:9e2c35e28d4f2d23e0ce7ad179b6cd66a5f0f7027094c3a958317027b6120340","observation_id":"24675a7a-8ed0-492b-936c-0641dffd635c","resolution":{"observed_at":"2026-08-07T00:42:09.578460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11990","last_updated":"2024-12-16T17:14:35Z","snapshot_observed_at":"2026-08-11T15:38:37.343796Z","submitted_at":"2024-12-16T17:14:35Z","title":"ExecRepoBench: Multi-level Executable Code Completion Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11990","snapshot_observed_at":"2026-08-07T00:42:09.581175Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.581175Z"},"links":{"cited_paper":"/paper/2412.11990","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:1c1a6af706dd254b25c298456e3ef834151ce014bdae63329eb13be0caa5513a","observation_id":"fe74c563-d4dd-4dc5-b662-b1f0fea7843e","resolution":{"observed_at":"2026-08-07T00:42:09.581175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13940","last_updated":"2024-06-20T02:19:33Z","snapshot_observed_at":"2026-08-12T23:38:47.485670Z","submitted_at":"2024-06-20T02:19:33Z","title":"AutoCAP: Towards Automatic Cross-lingual Alignment Planning for Zero-shot Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2406.13940","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13940","snapshot_observed_at":"2026-08-07T00:42:09.654333Z","title":"AutoCAP: Towards Automatic Cross-lingual Alignment Planning for Zero-shot Chain-of-Thought","venue":"cs.CL","work_id":"18778b0f-9cb5-4efe-8f18-323e29f152cd","year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.584295Z"},"links":{"cited_paper":"/paper/2406.13940","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:b0bd504eb356b28b9dfb4cff074f189acefa089a4326535f5bd515085abead13","observation_id":"063cda00-fa01-4b67-89e6-b99a3f73b3e4","resolution":{"observed_at":"2026-08-07T00:42:09.659523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T00:42:09.586993Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.586993Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:62f321be6ff7fdcbc6e29d0b4be47a07c577f693dfd22e56a96e04e7128a6d88","observation_id":"23cd262d-bb1c-4fbe-966c-4c8d68d585c9","resolution":{"observed_at":"2026-08-07T00:42:09.586993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:09.590571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.590571Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:43e43898209f280db5fd5a486edf7cda22f1208c241fed0404bae4e17a3b7c6d","observation_id":"b79cb329-4cbf-4f5c-9d14-4115f183e429","resolution":{"observed_at":"2026-08-07T00:42:09.590571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-07T00:42:09.593330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.593330Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:f4e13625cf36623025591b221501f027a39eeb7cb76434df35819c08d2aecb0c","observation_id":"61a8473b-cdf1-4c9e-b252-0f04e43c0e83","resolution":{"observed_at":"2026-08-07T00:42:09.593330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:09.596233Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.596233Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:c60b747544dff48e712f46656be3ca52a3804a20d2b8f7f8ee1254b5c21c5195","observation_id":"3874e825-485e-42cb-a7f3-f6567807dd3f","resolution":{"observed_at":"2026-08-07T00:42:09.596233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:09.599158Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:09.599158Z"},"links":{"citing_paper":"/paper/2506.13824"},"observation_digest":"sha256:89de03eff69e961f27b2271e0d715d2cdcee30d432de112a313b77f55c315785","observation_id":"5ea54a15-2107-45c0-982c-284ade1afa3f","resolution":{"observed_at":"2026-08-07T00:42:09.599158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13824","last_updated":"2025-06-15T13:02:59Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-13T03:06:57.104152Z","submitted_at":"2025-06-15T13:02:59Z","title":"MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2506.13824."}