{"as_of":"2026-08-10T00:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c616f82d801ae4a48d8c796309d8638fdb3d15ff832da1fd6faadf73f76b10bf","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:08:50.185042Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:25:09.639122Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:59:37.262688Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":"2507.09063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-07-04T06:59:37.262688Z","title":"Setupbench: Assessing software engineering agents’ ability to bootstrap development environments","venue":null,"work_id":"db3dc07a-47e6-4f8a-9da7-0a5ad98429ad","year":2025},"citing_paper":{"arxiv_id":"2605.15815","last_updated":"2026-05-15T10:09:59Z","snapshot_observed_at":"2026-08-01T21:40:05.316602Z","submitted_at":"2026-05-15T10:09:59Z","title":"BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T17:04:07.449733Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2605.15815"},"observation_digest":"sha256:89aa61d387b7ca897009d9264589e9396d064e6db4556ac4c02b2b4a5bcdf6bc","observation_id":"ffbff7db-862b-4a39-a151-2dd1eed36654","resolution":{"observed_at":"2026-05-20T17:08:41.972644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":"2507.09063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-07-04T06:59:37.262688Z","title":"Setupbench: Assessing software engineering agents’ ability to bootstrap development environments","venue":null,"work_id":"db3dc07a-47e6-4f8a-9da7-0a5ad98429ad","year":2025},"citing_paper":{"arxiv_id":"2606.05238","last_updated":"2026-06-03T04:59:34Z","snapshot_observed_at":"2026-08-07T17:24:30.080649Z","submitted_at":"2026-06-03T04:59:34Z","title":"DeployBench: Benchmarking LLM Agents for Research Artifact Deployment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T05:35:12.027697Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2606.05238"},"observation_digest":"sha256:56d8d6399e9a9d49a251f641db5ab11cb4a455b8f6ba17d55e854e711a853c0a","observation_id":"a46cff9f-fb2b-450e-a320-c89f9805d8d8","resolution":{"observed_at":"2026-07-02T09:16:49.263539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":"2507.09063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-07-04T06:59:37.262688Z","title":"Setupbench: Assessing software engineering agents’ ability to bootstrap development environments","venue":null,"work_id":"db3dc07a-47e6-4f8a-9da7-0a5ad98429ad","year":2025},"citing_paper":{"arxiv_id":"2606.21071","last_updated":"2026-06-19T03:40:00Z","snapshot_observed_at":"2026-08-06T19:34:26.539767Z","submitted_at":"2026-06-19T03:40:00Z","title":"Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:02:37.404821Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2606.21071"},"observation_digest":"sha256:51dbfa1dae297750a5537277981f384173cc368612f99e094b3b1cd32bb83cf2","observation_id":"019662f6-356d-4c7d-9f4c-df963549c716","resolution":{"observed_at":"2026-07-04T06:59:37.264275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":"2507.09063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-07-04T06:59:37.262688Z","title":"Setupbench: Assessing software engineering agents’ ability to bootstrap development environments","venue":null,"work_id":"db3dc07a-47e6-4f8a-9da7-0a5ad98429ad","year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:591bb1f212408b1feb046872325998843a6aba80734da79a6d1e3914174511f1","observation_id":"d0300806-5c46-477b-aae5-08da90ed168a","resolution":{"observed_at":"2026-07-01T15:35:48.608177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-08-03T00:25:09.639122Z","title":"arXiv preprint arXiv:2507.09063 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:09.639122Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:330e9dd67ed68c0f41d83b68f5676e8f2d5d11704938a0d7d1b92a044ac518f8","observation_id":"e5abfd60-86ad-4964-a30f-6ce9e6e87fca","resolution":{"observed_at":"2026-08-03T00:25:09.639122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09063/citation-record","integrity":"/paper/2507.09063/integrity","json":"/paper/2507.09063/citation-record.json","paper":"/paper/2507.09063"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.08333","last_updated":"2025-07-08T23:14:43Z","snapshot_observed_at":"2026-07-06T19:01:15.196625Z","submitted_at":"2024-08-14T22:53:07Z","title":"CodeMirage: Hallucinations in Code Generated by Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08333","snapshot_observed_at":"2026-08-06T18:08:42.937431Z","title":"Codemirage: Hallucinations in code generated by large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:42.937431Z"},"links":{"cited_paper":"/paper/2408.08333","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:7626c29fc496f33714614fe54963db46893a39e6089c3d5fff71708a312a7442","observation_id":"50d5f51c-86b7-461d-bbf0-380d477824ac","resolution":{"observed_at":"2026-08-06T18:08:42.937431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:53.062593Z","title":"Aider code editing","venue":null,"work_id":"8f8e74aa-a99f-416c-96d4-c1b066c9f985","year":null},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:43.101216Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:22a363f08ab7882f2be1e1790c46c47cb74efe682d50134ad6bb5596e36a1aa5","observation_id":"9297bddf-9034-42d8-a918-4095eea14f66","resolution":{"observed_at":"2026-08-06T18:08:53.176750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.956825Z","title":"Introducing claude 4","venue":null,"work_id":"3ec81592-c815-4e63-af63-1550cead45fc","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:43.534078Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:d4811ff52b0c7efcde2820f00b161683c54bdb8d194a76742aa130ae3aac1bdd","observation_id":"6da50e90-6837-4278-b2a5-d5a6b69f218d","resolution":{"observed_at":"2026-08-06T18:08:53.007049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.717132Z","title":"Meet devin, the first ai software engineer","venue":null,"work_id":"c7e697a5-8084-4e7b-b793-9dbb1bd9e880","year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:44.557141Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:929a26079f849bd822607e40cd4caa31c98db53af47911437c855f41f54c0354","observation_id":"3890ee47-51a6-443c-b208-cb69d2cba843","resolution":{"observed_at":"2026-08-06T18:08:52.841914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.622233Z","title":"Envbench: A benchmark for automated environment setup","venue":null,"work_id":"cab01450-ee64-469e-9110-629ee3f08b92","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:45.312916Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:3d6c9bcfd39967faf12d5bb878b69ff37cf32661e7b8b20e12560f1581f6fad9","observation_id":"d879eca9-43f8-45dd-88cc-d681e778c0de","resolution":{"observed_at":"2026-08-06T18:08:52.672129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.523574Z","title":"Code completions with github copilot","venue":null,"work_id":"c7c0ce3c-baa9-4198-8ea0-63272e5237f5","year":2022},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:46.040321Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:aa8e907040c466732787a1bedc165377788c0bb1c4c62289b095e49f77211b43","observation_id":"e48daeb8-4b10-4042-91ba-34afbfcdc666","resolution":{"observed_at":"2026-08-06T18:08:52.561243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.379409Z","title":"Meet the new github copilot coding agent","venue":null,"work_id":"fe280ee6-b5c7-4c00-9348-70d3c353d630","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:46.588514Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:8f565d765aebcea8468e30b75ca68863878a82fd5c5ca7587f0122e792bf7b94","observation_id":"033ba43f-9853-492f-a666-53e636a432df","resolution":{"observed_at":"2026-08-06T18:08:52.434166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:46.856121Z","title":"S table T ool B ench: Towards stable large-scale benchmarking on tool learning of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:46.856121Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:c337d7e1d101338acf248e0b2a09a623420b28a336eb49a94539d5a7b0b06f92","observation_id":"e125de41-40e0-4d9b-ac1e-2b951395e8a3","resolution":{"observed_at":"2026-08-06T18:08:46.856121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09997","last_updated":"2024-10-13T20:41:47Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T20:41:47Z","title":"Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09997","snapshot_observed_at":"2026-08-06T18:08:46.990851Z","title":"Collu- B ench: A benchmark for predicting language model hallucinations in code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:46.990851Z"},"links":{"cited_paper":"/paper/2410.09997","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:c14bd8490885abb54e065ca8258e4e0665d2b6810f64d1119c45951306eb5947","observation_id":"37340459-c733-4faf-be3e-941b902b7aa6","resolution":{"observed_at":"2026-08-06T18:08:46.990851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:47.207136Z","title":"SWE -bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:47.207136Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:4ccfaf80b1da481f01129342ac518f295ce019d2c7d41a3c58407f8543372aa9","observation_id":"64aadbcc-7bd0-4e5e-b9fd-a6a96feeaaf6","resolution":{"observed_at":"2026-08-06T18:08:47.207136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20825","last_updated":"2025-02-28T08:12:08Z","snapshot_observed_at":"2026-08-07T17:40:33.661773Z","submitted_at":"2025-02-28T08:12:08Z","title":"LADs: Leveraging LLMs for AI-Driven DevOps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20825","snapshot_observed_at":"2026-08-06T18:08:47.452716Z","title":"Butt, and Ali Anwar","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:47.452716Z"},"links":{"cited_paper":"/paper/2502.20825","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:d468065c42dbf626d8d2a6c05dc756a63346e1f4fb918f3d02057c0b30da96ab","observation_id":"189efb8e-726d-4d8c-a012-748ab8cbcddd","resolution":{"observed_at":"2026-08-06T18:08:47.452716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08604","last_updated":"2024-12-14T09:45:51Z","snapshot_observed_at":"2026-08-06T13:32:36.381010Z","submitted_at":"2024-03-13T15:13:44Z","title":"Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08604","snapshot_observed_at":"2026-08-06T18:08:47.747783Z","title":"Devbench: A comprehensive benchmark for software development","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:47.747783Z"},"links":{"cited_paper":"/paper/2403.08604","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:93d0bd53abd357b1ffcd0486f47317305d8023fa5f499924539dc14ab2d009d1","observation_id":"2e45cd78-68a0-416c-b7a8-3838f9ccc14d","resolution":{"observed_at":"2026-08-06T18:08:47.747783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03227","last_updated":"2024-10-04T08:29:12Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:29:12Z","title":"ALR$^2$: A Retrieve-then-Reason Framework for Long-context Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03227","snapshot_observed_at":"2026-08-06T18:08:47.901841Z","title":"ALR ^ 2 : A retrieve-then-reason framework for long-context question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:47.901841Z"},"links":{"cited_paper":"/paper/2410.03227","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:de4166763762364758d181d7a3c53a46317643be0f95fd65355b4cde08845b91","observation_id":"ef28d23c-67e6-42d2-ae3b-65b2ce6c1acb","resolution":{"observed_at":"2026-08-06T18:08:47.901841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02060","last_updated":"2024-06-12T02:46:16Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T15:59:11Z","title":"Long-context LLMs Struggle with Long In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02060","snapshot_observed_at":"2026-08-06T18:08:48.218778Z","title":"Long-context llms struggle with long in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:48.218778Z"},"links":{"cited_paper":"/paper/2404.02060","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:375f217783e706d5040dcff4d18990dbe4beeb8388efb59247d5975ee18df7e7","observation_id":"a1b86a78-b459-40bb-ae34-1b76186d72e9","resolution":{"observed_at":"2026-08-06T18:08:48.218778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08979","last_updated":"2018-03-02T17:46:59Z","snapshot_observed_at":"2026-07-06T06:25:13.996890Z","submitted_at":"2018-02-25T09:52:24Z","title":"NL2Bash: A Corpus and Semantic Parser for Natural Language Interface to the Linux Operating System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08979","snapshot_observed_at":"2026-08-06T18:08:48.471016Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:48.471016Z"},"links":{"cited_paper":"/paper/1802.08979","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:da8025e135dd6931c57e40deea91d2ef5083a40bd4fd907108a04b5cfafe4ed6","observation_id":"172e390e-a508-4fed-81b8-56cdc56880a2","resolution":{"observed_at":"2026-08-06T18:08:48.471016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22583","last_updated":"2025-05-28T16:56:11Z","snapshot_observed_at":"2026-08-07T13:01:10.862995Z","submitted_at":"2025-05-28T16:56:11Z","title":"GitGoodBench: A Novel Benchmark For Evaluating Agentic Performance On Git","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22583","snapshot_observed_at":"2026-08-06T18:08:48.894069Z","title":"Gitgoodbench: A novel benchmark for evaluating agentic performance on git","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:48.894069Z"},"links":{"cited_paper":"/paper/2505.22583","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:6985c242c525e01cb07f4cd5a610a25fd2732ed19dd577796ea6c2ac9be277bc","observation_id":"b22a4f2a-f6e4-41ac-ba8b-904495d780e1","resolution":{"observed_at":"2026-08-06T18:08:48.894069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.043362Z","title":"Agent B ench: Evaluating LLM s as agents","venue":null,"work_id":"482ed29e-0ba6-4039-81a8-0a31ad501631","year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.409404Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:28556d29eea539a12bf8f971675711b25f5a2f82dbe4e90bd77af81dfaaf7587","observation_id":"1f1c29eb-498d-45fc-8586-90fdbe2c509a","resolution":{"observed_at":"2026-08-06T18:08:52.185296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07637","last_updated":"2025-06-17T12:53:20Z","snapshot_observed_at":"2026-07-06T16:31:21.196640Z","submitted_at":"2023-10-11T16:33:29Z","title":"OpsEval: A Comprehensive IT Operations Benchmark Suite for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07637","snapshot_observed_at":"2026-08-06T18:08:49.556866Z","title":"Opseval: A comprehensive benchmark suite for evaluating large language models’ capability in the IT operations domain","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.556866Z"},"links":{"cited_paper":"/paper/2310.07637","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:36c9c616d13f0fd88f7273043c4511781d421aea2196dc18c4032ef0a72e546a","observation_id":"465e73db-8c85-484f-bde7-400bdb029460","resolution":{"observed_at":"2026-08-06T18:08:49.556866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:51.715300Z","title":"Beyond pip install : Evaluating llm agents for the automated installation of python projects","venue":null,"work_id":"f99f16c8-6848-46a3-a4b0-b4bc3b0b16d0","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.657176Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:d0037bab5e12ebcd45cd0b38f536764e4aa2120ac09e85021736fc70086b2012","observation_id":"f4d4ff97-6a2b-4a42-9c02-08faba3b1908","resolution":{"observed_at":"2026-08-06T18:08:51.886387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13114","last_updated":"2025-08-17T07:22:50Z","snapshot_observed_at":"2026-08-09T15:58:06.834746Z","submitted_at":"2025-06-16T05:45:03Z","title":"Understanding LLM-Centric Challenges for Deep Learning Frameworks: An Empirical Analysis","version":2},"cited_work":{"arxiv_id":"2506.13114","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13114","snapshot_observed_at":"2026-08-06T18:08:50.650458Z","title":"Understanding LLM-Centric Challenges for Deep Learning Frameworks: An Empirical Analysis","venue":"cs.SE","work_id":"35d90a01-b953-4164-8bac-f3043dd8c229","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.760261Z"},"links":{"cited_paper":"/paper/2506.13114","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:50d4a99db06d30e140bcb2e8fa7fc2cab071e26ce5965162f64d016f245288f8","observation_id":"873b81fd-f42a-4b8f-b0ec-65c6c81668f8","resolution":{"observed_at":"2026-08-06T18:08:50.730388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09392","last_updated":"2025-05-15T11:14:38Z","snapshot_observed_at":"2026-08-07T15:45:25.774318Z","submitted_at":"2025-05-14T13:48:33Z","title":"Mitigating Configuration Differences Between Development and Production Environments: A Catalog of Strategies","version":2},"cited_work":{"arxiv_id":"2505.09392","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09392","snapshot_observed_at":"2026-08-06T18:08:50.514464Z","title":"Mitigating Configuration Differences Between Development and Production Environments: A Catalog of Strategies","venue":"cs.SE","work_id":"abe80015-d7c9-496b-8bb5-4a3e89901486","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.838672Z"},"links":{"cited_paper":"/paper/2505.09392","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:cd9a2377c291408cdf0b0f5f47579845f423a428e21e9a9446eeac33192dddae","observation_id":"d1f09481-964e-487a-a003-74c3ccfc8592","resolution":{"observed_at":"2026-08-06T18:08:50.560978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18379","last_updated":"2024-10-24T02:43:33Z","snapshot_observed_at":"2026-08-04T04:27:13.746069Z","submitted_at":"2024-10-24T02:43:33Z","title":"Identifying Factors Contributing to Bad Days for Software Developers: A Mixed Methods Study","version":1},"cited_work":{"arxiv_id":"2410.18379","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18379","snapshot_observed_at":"2026-08-06T18:08:50.319099Z","title":"Identifying Factors Contributing to Bad Days for Software Developers: A Mixed Methods Study","venue":"cs.SE","work_id":"c0a64a05-eb9f-4447-b52e-00fb8c544157","year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.949818Z"},"links":{"cited_paper":"/paper/2410.18379","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:95f650ef3d6871628ac5c233ad1dbd2f12469e6a611d45179455bb0f288f0179","observation_id":"a745daca-bc41-4f02-b73e-483b5074a561","resolution":{"observed_at":"2026-08-06T18:08:50.393493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:51.323274Z","title":"Introducing codex","venue":null,"work_id":"a482f47c-a674-49aa-b59e-5602c533fece","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:50.015354Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:53857aa6e36ce0fe197669e5fb80ce3d79eb50a31f0551382f2e6bf73c57ef6a","observation_id":"1f59e4bb-8f10-4883-9797-937ad07ba375","resolution":{"observed_at":"2026-08-06T18:08:51.532796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:50.078862Z","title":"Tool LLM : Facilitating large language models to master 16000+ real-world API s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:50.078862Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:6e2d6edcfb2ded74d6e73e5d9d02b44788784ce293b8f98efc7f2b3edd5b479a","observation_id":"6c10f197-0d49-4891-b04d-e5f550e034ff","resolution":{"observed_at":"2026-08-06T18:08:50.078862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:51.031734Z","title":"Retrieval models aren't tool-savvy: Benchmarking tool retrieval for large language models","venue":null,"work_id":"663c3669-b502-4f24-9cba-7d1a3f80178d","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:50.185042Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:bc4590cd739af00e209aba838e2b6cd4fd23a2f917a5dbfd106d3661c54d3e09","observation_id":"14cdc954-7a61-4ff9-ae2b-9710a708ce93","resolution":{"observed_at":"2026-08-06T18:08:51.106233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-10T00:14:56.262216Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 5 inbound Pith citation observations for arXiv:2507.09063."}