{"as_of":"2026-08-14T08:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5a0b1ae2ba58bb03eda4f0ddb5cb47199ccb33cacf5caf1175b7edab80d4926","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:21:50.175416Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06411/citation-record","integrity":"/paper/2607.06411/integrity","json":"/paper/2607.06411/citation-record.json","paper":"/paper/2607.06411"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-02T08:21:49.708376Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:49.708376Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:a87df404a396f48e5574d3c40b0e3c2a85ff8710614672284bb0e85af9a20250","observation_id":"25153bba-7766-48ff-8da2-350b24c0482f","resolution":{"observed_at":"2026-08-02T08:21:49.708376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-02T08:21:49.775844Z","title":"Aleithan, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:49.775844Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:12fec37e34e98163f6ccb9bb76d3fbf3a69e4a479993cc16749c7a7b69a57886","observation_id":"7f097b81-7b4e-4618-9fa7-f37081d6ea79","resolution":{"observed_at":"2026-08-02T08:21:49.775844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:49.976954Z","title":"Liang, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:49.976954Z"},"links":{"citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:ff1bb25efbbc67fb3475120c714dcb6724e10ad9b47ea2c908ee577f0b586bae","observation_id":"20828afc-0fec-467e-9933-0bd1187ff184","resolution":{"observed_at":"2026-08-02T08:21:49.976954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:50.107696Z","title":"Prathifkumar, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.107696Z"},"links":{"citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:672b1c336e12b66aa157fcc78e5a75da196e28c8c42bc64730ffca1d2f4ed141","observation_id":"c2414804-da3f-4c9a-a437-59199db19a10","resolution":{"observed_at":"2026-08-02T08:21:50.107696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-02T08:21:50.110905Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.110905Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:a85ed8e55ef6bc36c4912054bf93cb93367d724d8fdfad21d1debbd64c9c7777","observation_id":"49f5b076-22b7-43ab-a7d4-47a40943f5e4","resolution":{"observed_at":"2026-08-02T08:21:50.110905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:50.113607Z","title":"Badertdinov, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.113607Z"},"links":{"citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:21c05c68b483b6dc4a33567df0e57a9e52ce90a5dddb0af011243da55011c5e1","observation_id":"67a67033-2161-4465-93c2-71fcfe096b3f","resolution":{"observed_at":"2026-08-02T08:21:50.113607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11059","last_updated":"2026-07-11T11:56:31Z","snapshot_observed_at":"2026-08-08T15:46:21.795392Z","submitted_at":"2025-07-15T07:52:33Z","title":"SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11059","snapshot_observed_at":"2026-08-02T08:21:50.116198Z","title":"Adamenko, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.116198Z"},"links":{"cited_paper":"/paper/2507.11059","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:71385289f10c4f0ecab420036ad184d392a62f99453513322f58c40e9fe6a554","observation_id":"ca14c0ea-849c-4e29-b863-c20cd752f562","resolution":{"observed_at":"2026-08-02T08:21:50.116198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:50.119591Z","title":"Chervyakov, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.119591Z"},"links":{"citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:1094cf2646fa8971314156c6907b589b3e3b727d2214fa979472c0a413b96d4e","observation_id":"ba49c9f0-5eed-44f6-afb9-69243e087812","resolution":{"observed_at":"2026-08-02T08:21:50.119591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:50.122122Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.122122Z"},"links":{"citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:4c5d7f830a306f70cbb0292858189ca7c92130ccf7c66feb035925f58821443b","observation_id":"1bb4a7d5-bffc-4c28-9bb3-313c05f67bdb","resolution":{"observed_at":"2026-08-02T08:21:50.122122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14210","last_updated":"2026-04-06T18:27:00Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-06T18:27:00Z","title":"Chinese Language Is Not More Efficient Than English in Vibe Coding: A Preliminary Study on Token Cost and Problem-Solving Rate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14210","snapshot_observed_at":"2026-08-02T08:21:50.124329Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.124329Z"},"links":{"cited_paper":"/paper/2604.14210","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:e5994fd40d9effa0236845b2343b33321ecae31683b5cd08f3da01118068dff8","observation_id":"398a7918-8eb2-47f4-bcc1-6394e362bd83","resolution":{"observed_at":"2026-08-02T08:21:50.124329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02605","last_updated":"2025-04-03T14:06:17Z","snapshot_observed_at":"2026-08-09T23:51:45.534260Z","submitted_at":"2025-04-03T14:06:17Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02605","snapshot_observed_at":"2026-08-02T08:21:50.127140Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.127140Z"},"links":{"cited_paper":"/paper/2504.02605","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:36c2e42e5ccd43d18206bb58b0f4c5c4344be9076d9529adf009bec38eafb275","observation_id":"ffc6dabd-4f26-488a-8066-685959e86027","resolution":{"observed_at":"2026-08-02T08:21:50.127140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-02T08:21:50.129688Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.129688Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:9e6ba5ad1acb84df9f36cb9b118e5a7f8071a144f96ad1a0efaa1c26cd37623e","observation_id":"1327ca94-c8d9-4bf7-a999-1f1c80b399dd","resolution":{"observed_at":"2026-08-02T08:21:50.129688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-08-13T10:06:26.439949Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-02T08:21:50.132378Z","title":"Mialon, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.132378Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:1a6db72203bc7b7042c75d4dae3512518d2f93f3e986a00f6a87bc0fe764cc3c","observation_id":"448f7704-aa64-4cd9-b2ed-553bc86daad9","resolution":{"observed_at":"2026-08-02T08:21:50.132378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-12T16:49:10.970507Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-02T08:21:50.134928Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.134928Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:43daf13b5116de30a0673eb1183d3f1c1bf19e6299ab59fdd30b224818c1c901","observation_id":"961877a6-14a1-4ed2-aa27-9d8b3536c034","resolution":{"observed_at":"2026-08-02T08:21:50.134928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-02T08:21:50.137021Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.137021Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:e42c8218eab4c05badfc05b1331b06b0376012a8b50c110641e580b5f0300c3d","observation_id":"666f9baf-c066-44ac-af9a-50f1e1eb8987","resolution":{"observed_at":"2026-08-02T08:21:50.137021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00640","last_updated":"2024-11-01T14:57:16Z","snapshot_observed_at":"2026-08-12T22:09:41.196978Z","submitted_at":"2024-11-01T14:57:16Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00640","snapshot_observed_at":"2026-08-02T08:21:50.139165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.139165Z"},"links":{"cited_paper":"/paper/2411.00640","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:aaee9fbe9bef26bfced0ae2f9baa4a1b4fc873403e7dc2d7a2749403c59422ba","observation_id":"dbf58742-749a-4db9-b16e-c2eb66ffed38","resolution":{"observed_at":"2026-08-02T08:21:50.139165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01502","last_updated":"2024-07-01T17:48:14Z","snapshot_observed_at":"2026-08-12T23:31:03.691496Z","submitted_at":"2024-07-01T17:48:14Z","title":"AI Agents That Matter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01502","snapshot_observed_at":"2026-08-02T08:21:50.141580Z","title":"Kapoor, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.141580Z"},"links":{"cited_paper":"/paper/2407.01502","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:56f487ba26764b3e4704f8856fcec01607b66242856ce14e34f03106495e8862","observation_id":"3b95bbdd-6e60-4b0f-9f58-9c40fb52cc0f","resolution":{"observed_at":"2026-08-02T08:21:50.141580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:50.143937Z","title":"Kapoor, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.143937Z"},"links":{"citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:a139e23c32903b5130da8909af6c7c1e358b0efb8ac14bdc2931dc0ff2b7edec","observation_id":"fc84386f-7bd2-4ece-b298-087048b31f8a","resolution":{"observed_at":"2026-08-02T08:21:50.143937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14499","last_updated":"2026-07-10T21:48:09Z","snapshot_observed_at":"2026-08-07T16:54:09.525403Z","submitted_at":"2025-03-18T17:59:31Z","title":"Measuring AI Ability to Complete Long Software Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14499","snapshot_observed_at":"2026-08-02T08:21:50.145877Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.145877Z"},"links":{"cited_paper":"/paper/2503.14499","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:77f3f29d508bc2354dc9f7d50556209d4c9178cd47416a7ef46fe89b58ae1612","observation_id":"087ac713-6a1f-45db-ba43-78014aef5628","resolution":{"observed_at":"2026-08-02T08:21:50.145877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15114","last_updated":"2025-05-27T03:32:23Z","snapshot_observed_at":"2026-08-12T16:49:37.896696Z","submitted_at":"2024-11-22T18:30:46Z","title":"RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15114","snapshot_observed_at":"2026-08-02T08:21:50.147998Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.147998Z"},"links":{"cited_paper":"/paper/2411.15114","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:562d408458868d27510957265461e65f5643ce2d41d8345d1a4fa17bfd5e8119","observation_id":"58fcc192-7e31-4da4-944f-af8b18859fb3","resolution":{"observed_at":"2026-08-02T08:21:50.147998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-14T00:08:59.565509Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-02T08:21:50.150187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.150187Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:63d64d4b4d2d60003d730d9f218fe7ba8b4f8d11d612a06e02f179b5cb1b3efe","observation_id":"dc4bb9bc-feab-490c-b45e-35719505f9ec","resolution":{"observed_at":"2026-08-02T08:21:50.150187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.21140","last_updated":"2026-08-06T08:32:42Z","snapshot_observed_at":"2026-08-09T23:09:48.993758Z","submitted_at":"2026-06-19T06:26:32Z","title":"Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.21140","snapshot_observed_at":"2026-08-02T08:21:50.152279Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.152279Z"},"links":{"cited_paper":"/paper/2606.21140","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:5a2ac3f22bd8b38d2a6adc97b33d8f28fc397e853de547995bc6781d9ef60f14","observation_id":"220659b0-5cb8-4906-bd48-13c981ac6111","resolution":{"observed_at":"2026-08-02T08:21:50.152279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11831","last_updated":"2026-01-15T23:30:35Z","snapshot_observed_at":"2026-07-06T21:25:27.942187Z","submitted_at":"2025-05-17T04:34:48Z","title":"ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11831","snapshot_observed_at":"2026-08-02T08:21:50.154596Z","title":"Chollet, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.154596Z"},"links":{"cited_paper":"/paper/2505.11831","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:ff7009c5d414bb66424e6d177fdcb6eb76f7b50549fcb62a00039e8a174d2f1f","observation_id":"036e3ce2-2e83-4ef4-820a-aec381f84720","resolution":{"observed_at":"2026-08-02T08:21:50.154596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-02T08:21:50.156961Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.156961Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:a24d6de38bbd0177892ab71f903e08487bf937e90155a94033d5826014ef4b26","observation_id":"1e3db29c-191f-47ba-8277-1711100b9253","resolution":{"observed_at":"2026-08-02T08:21:50.156961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20879","last_updated":"2025-05-12T16:33:58Z","snapshot_observed_at":"2026-08-07T15:58:09.672851Z","submitted_at":"2025-04-29T15:48:49Z","title":"The Leaderboard Illusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20879","snapshot_observed_at":"2026-08-02T08:21:50.159277Z","title":"Singh, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.159277Z"},"links":{"cited_paper":"/paper/2504.20879","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:9c84b961cc3b2bce563e34767b7020aac435468ac1c75fbbe55a8b29a3169e6f","observation_id":"3877d2cc-b2d2-4b87-acf0-9b9500240cf6","resolution":{"observed_at":"2026-08-02T08:21:50.159277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-02T08:21:50.161820Z","title":"Srivastava, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.161820Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:aed03ab7d8258df2bfa16c5d27b2e754529833b187064deaccdc123e424cd056","observation_id":"9fcad652-77e6-4baf-95bc-178d169639c5","resolution":{"observed_at":"2026-08-02T08:21:50.161820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08388","last_updated":"2023-02-07T03:12:50Z","snapshot_observed_at":"2026-08-13T16:22:17.918832Z","submitted_at":"2022-03-16T04:21:50Z","title":"MCoNaLa: A Benchmark for Code Generation from Multiple Natural Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08388","snapshot_observed_at":"2026-08-02T08:21:50.163874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.163874Z"},"links":{"cited_paper":"/paper/2203.08388","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:a6b118b421d8bd73c49298e0bc642087df0b823e31c23b9f3051a9d639cf30aa","observation_id":"d9069d21-4c4a-469a-ad8c-0bd1f78a22aa","resolution":{"observed_at":"2026-08-02T08:21:50.163874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10481","last_updated":"2023-05-19T14:27:46Z","snapshot_observed_at":"2026-08-13T13:17:56.095215Z","submitted_at":"2022-12-20T17:54:37Z","title":"Execution-Based Evaluation for Open-Domain Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10481","snapshot_observed_at":"2026-08-02T08:21:50.166018Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.166018Z"},"links":{"cited_paper":"/paper/2212.10481","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:92133e666171e91cb62e2e9ff442570cb579ad97e03c4ddc1c35c5573c2afbd1","observation_id":"aa951d9d-e589-41f3-9cc1-f482a6729cc1","resolution":{"observed_at":"2026-08-02T08:21:50.166018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16694","last_updated":"2024-03-24T15:41:21Z","snapshot_observed_at":"2026-08-13T22:46:34.001827Z","submitted_at":"2024-02-26T16:09:00Z","title":"HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16694","snapshot_observed_at":"2026-08-02T08:21:50.168183Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.168183Z"},"links":{"cited_paper":"/paper/2402.16694","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:2b86469dc06b60a57fcc7cccdf16aa85f56bfc320be1d34c1fb98429e40c1b01","observation_id":"05b12bbe-234b-4b37-b526-95b20b9c02b4","resolution":{"observed_at":"2026-08-02T08:21:50.168183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:50.171250Z","title":"Если FSM-контекст для апдейта недоступен — сценная обвязка спокойно пропускает апдейт дальше, а не падает","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.171250Z"},"links":{"citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:b4d113e9d76a4dbbb48709badb6d58583157efe4619fb7359eb7d6a34605c727","observation_id":"1e75f657-3fea-452f-a6db-d3c2d022cfea","resolution":{"observed_at":"2026-08-02T08:21:50.171250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:50.173335Z","title":"Для стратегий FSM, которые и так работают в разрезе чата (CHAT и CHAT_TOPIC), контекст должен определяться и без пользователя — по самому ча- ту/каналу","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.173335Z"},"links":{"citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:d2a2ab1edb62c056b66af9f5a6ecdab229afb809d6bf838935af10aed59441be","observation_id":"7413c14b-3663-49a1-8334-82ff3405278a","resolution":{"observed_at":"2026-08-02T08:21:50.173335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:50.175416Z","title":"Существующее поведение для личек и групп ломать нельзя: боты со сценами и без, которые сейчас работают, должны работать ровно как раньше","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:50.175416Z"},"links":{"citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:832d8a3cbbf9c1d820931ee137e790261f9e533ed336a3742560178c4a93fa97","observation_id":"8adc0628-f9d6-4f33-b356-ab6f51a01607","resolution":{"observed_at":"2026-08-02T08:21:50.175416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","latest_version":2,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2607.06411."}