{"as_of":"2026-08-18T18:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b0ffab7d62fe865d59e97aad744ad21487d412a8faad14c70c44547854ed5d3","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T16:44:18.994680Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.01317/citation-record","integrity":"/paper/2606.01317/integrity","json":"/paper/2606.01317/citation-record.json","paper":"/paper/2606.01317"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-08-15T19:46:54.909325Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":"2202.03286","doi":"10.48550/arxiv.2202.03286","metadata_source":"pith","pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Red Teaming Language Models with Language Models","venue":"cs.CL","work_id":"d1274c54-508f-42f9-aeb3-91db13f3a622","year":2022},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:1045c99864875c6ad4e4aac2f65b1622b662a4724675c6d202de8714df2738c9","observation_id":"b0a007ea-a870-4cc8-8a61-7d1dd199d7fc","resolution":{"observed_at":"2026-07-01T21:36:15.071498Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-14T22:08:09.310411+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T22:08:09.310411+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Proceedings of the 16th","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:9b2585e2dd2e84e343222977ff40cecb0d092d07fb5658a7f93e77855e1e41f5","observation_id":"4c814a72-2663-40e0-ab91-eb609f048e7b","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Extracting Training Data from Large Language Models , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:1b10e1e1f7371a4d1e1e73f033fd20b1962fc5cc6b74edcafc0b05974c2e41e2","observation_id":"7b90fe33-20b8-4630-90f4-95fefb774868","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-16T00:51:32.846970Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":"2308.03688","doi":"10.1109/fllm63129.2024.10852426","metadata_source":"pith","pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AgentBench: Evaluating LLMs as Agents","venue":"cs.AI","work_id":"a37549b4-4c94-412d-acc4-4efeb08509be","year":2023},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:84bfa48e5bae4f92d740b9f0a4fb1927b90603c74380f016d3e67294631fe61b","observation_id":"d7459563-31e4-4fdc-9422-086420ed3837","resolution":{"observed_at":"2026-07-01T21:36:15.069087Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:33e61208fcc8f6073955ff75e2f166fe9c5270ea5dd9111585ae360b213c495d","observation_id":"9f57470a-be26-4ef8-97cd-cbd67dd9186b","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Forsyth and Dan Hendrycks , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:feca6181a81fd87f34198d175088a2077412f9133aebfffeb74238cf966f4aaf","observation_id":"1e53ebb4-1dec-42d3-bd00-6ed89d372d3c","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Chasing Shadows: Pitfalls in","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:95da07a4dddd8d9955cc872fdbc0eb6e85faec2d53f1491753d872d8c02fee17","observation_id":"3f34189b-fc60-43d2-b1bb-6419cf2d3b57","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Findings of the Association for Computational Linguistics (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:66ba568668eaf50b8defce73e3bda3231d089232822b7a8bef646a80ccaa889c","observation_id":"a2f23be2-0ab0-49d4-812b-3b7bf5847f92","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Zico Kolter and Matt Fredrikson and Yarin Gal and Xander Davies , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:4be554383b16834becd7388f4b5d11c80bbe027a39185f10bbb523f7c4ad511b","observation_id":"8c3ecaf5-4212-4eee-81a3-8fb7f4900011","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Advances in Neural Information Processing Systems (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:a68fd4205287744889127a28c59f19ab848b89421d85b4b46172a1c938d905fa","observation_id":"4a39f42e-d611-4a64-b9ae-ca9df611ec69","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:ddf95b766c69d73cc4bbe8ea1cc9c2c675fac36ec005cb2853294abd26c90388","observation_id":"13bcc762-ad98-4574-9b08-55292b7454a4","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Findings of the Association for Computational Linguistics (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:0ab671ac0f6dbcdc5d96f9e2df314d0c9b18e45bb1be335281bb1fb56312aed2","observation_id":"32c96666-bce1-412f-a7ea-35e976b6acc0","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.07391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.698688Z","title":"Qin, Y ., Liang, S., Ye, Y ., Zhu, K., Yan, L., Lu, Y ., Lin, Y ., Cong, X., Tang, X., Qian, B., et al","venue":null,"work_id":"8f8bcd20-c1e6-4d1f-a85f-401fd47e3acc","year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:b35358aded2c4c99bc17c38ff4644b218e2f2a23cffa2c4c2cc9d943099f68fb","observation_id":"d2321bcc-c45c-4a05-8b44-86d74c8aca49","resolution":{"observed_at":"2026-07-01T21:36:15.074645Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:b52fba201a8ab52212bc614708f02fb3d2e4eca946396562790f7dd74baefd1c","observation_id":"b2878297-f368-4b5f-ab3b-26ac00db564f","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:da2b82d869626fca41bc740a531f3895dc4fd323872b420f2e135a153a68171e","observation_id":"9c7489b0-7248-47a7-8e96-96eb6eb8252b","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:7350992c78e6307a4b2cf17df629c39cd09cb51ba657807ffe3c675d69c9088f","observation_id":"a553fda0-5d2c-4d78-9968-6217012cc40a","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"AgentDojo:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:feaac6642649021db3f495133ab073dd1a8af088cb12c227e888c8cad48a18cb","observation_id":"a0a44ef4-f4a6-4b81-9857-e86861ec49e5","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Zico Kolter and Matt Fredrikson , title =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:81c2d5273fc889bea7cda63d6990c62844b237f440ee2b7e4a283329e13261fe","observation_id":"ca446d45-f632-4055-8ae5-f677e5036214","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:0dd32fb097c5cf26381970e5a04886b9bf5bf86edbbbc85fc83e40598853535b","observation_id":"f1a0435e-8438-4dd0-8844-e0b1829426ff","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:d0f1289a52c1dff3c7aa1dfc6fb08ed2980dd6a9305213b4049045f6b764d917","observation_id":"88d93696-3e02-44b6-bf41-15f7cc886619","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:e00639e2f23dee4fa429d9495591a23344df8a666cfcf11a860ebbcf25cc7ae6","observation_id":"1cc0622c-f20f-4d7e-91c4-cbbbfeea2273","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:a51989e41079340964ba8ebd3e6cb6e66509409c056b93779628ce1806ce9aa6","observation_id":"ca95514f-71b0-451c-a019-a58b65b88753","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Maddison and Tatsunori Hashimoto , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:b32a99e71d40dffbd10accb77964e1f11fb5c08374548e366897c9054a78a998","observation_id":"63957f8f-a573-41e9-90bc-526d4c133cef","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:12c1a704b9a357e606f4ea53eb78feaf814dcc7aa4e9ea32e9c7f8040171eac3","observation_id":"bf7be383-ee5b-430c-98b0-968c893b5343","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04724","last_updated":"2023-12-07T22:07:54Z","snapshot_observed_at":"2026-08-16T14:36:40.398299Z","submitted_at":"2023-12-07T22:07:54Z","title":"Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models","version":1},"cited_work":{"arxiv_id":"2312.04724","doi":"10.48550/arxiv.2312.04724","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04724","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2312.04724 [cs]","venue":"arXiv (Cornell University)","work_id":"45b8079b-5204-450f-8024-f3a8142583a9","year":2023},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"cited_paper":"/paper/2312.04724","citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:1065f08c1f485437a993c7d69240065bb1e7403c024b5958ed54c86b6f6c2d9b","observation_id":"0e47e741-ab83-4a5a-aa3c-4c83b18a6e4d","resolution":{"observed_at":"2026-07-01T21:36:15.066149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Findings of the Association for Computational Linguistics:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:50abbaff2f915a565cc06bba95045121c6f4157d6d1170c1f8ebbd6d2292f3ce","observation_id":"71153747-9fc8-4aaa-b81c-dc3add28371f","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-18T03:21:40.231829Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":1,"unresolved":21,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2606.01317."}