{"as_of":"2026-08-09T04:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dadbc4e5efa23556322543181bc8843ab3f70385f56c372d7f5bf5432007a8ed","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:17:41.302535Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:15:10.107091Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20008","snapshot_observed_at":"2026-08-03T03:15:10.107091Z","title":"Simon, P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08690","last_updated":"2026-06-22T11:24:21Z","snapshot_observed_at":"2026-08-06T10:10:44.062711Z","submitted_at":"2026-02-09T14:12:41Z","title":"SoK: The Pitfalls of Deep Reinforcement Learning for Cybersecurity","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:10.107091Z"},"links":{"cited_paper":"/paper/2509.20008","citing_paper":"/paper/2602.08690"},"observation_digest":"sha256:5247e81b0e1b8a7a0ee4da8bc781692834ac7ea9cd9d44083f10e0fba461845a","observation_id":"fcd9be66-14d4-4393-9be7-407e6fbfb17b","resolution":{"observed_at":"2026-08-03T03:15:10.107091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.20008/citation-record","integrity":"/paper/2509.20008/integrity","json":"/paper/2509.20008/citation-record.json","paper":"/paper/2509.20008"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.853638Z","title":"Agarwal, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.853638Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:3a3ccea75d59821685ff7b73db685f21d457007faff1c0fee61a0c29b756224e","observation_id":"9c03587f-cd62-46d2-b440-85b222ccc9ea","resolution":{"observed_at":"2026-08-04T15:17:40.853638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.859321Z","title":"Akiba, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.859321Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:8ddb3f43c320552cb6b4d0668f2f8d8e27425352499ba1f419e27d735ff4548f","observation_id":"49bedf3e-1cba-41db-b6f0-7d884320023a","resolution":{"observed_at":"2026-08-04T15:17:40.859321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.865679Z","title":"Avalos, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.865679Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:4168896e19db61c200d5b9001323afd16f74ad67e6316bbe06928a57a0763227","observation_id":"a21679c6-6be6-420d-9162-78096056f9a7","resolution":{"observed_at":"2026-08-04T15:17:40.865679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.871209Z","title":"Algorithmsforhyper-parameter optimization.Advances in neural information processing systems, 24, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.871209Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:953e12943d9c043c07c02f7c9045fc81b4dd05a04b26a2013129ff60dc620627","observation_id":"e296691a-907d-41f6-a834-d20a92fae4d8","resolution":{"observed_at":"2026-08-04T15:17:40.871209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-04T15:17:40.876898Z","title":"Berner, G","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.876898Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:64046421ae4107aaf43e4c68a68f515381c169ae5df305159181b7b3f5cc326d","observation_id":"6d966730-60e6-4c38-9a67-6bed0c793947","resolution":{"observed_at":"2026-08-04T15:17:40.876898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.882716Z","title":"Leveragingproceduralgeneration to benchmark reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.882716Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:d3e89c76439837784245e997a3734c113a0f6af06bc168c408a6777ced4edd04","observation_id":"69e4e99d-db93-44ca-87ab-73a3456018e7","resolution":{"observed_at":"2026-08-04T15:17:40.882716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.889168Z","title":"Quantifyinggeneraliza- tion in reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.889168Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:0c77b42ee60feaa12aca9d595082d8e64cade75e30f3eb4ef686e4b177bf8c87","observation_id":"bf416b4e-2a73-4618-b2a4-6cb785d7c7a8","resolution":{"observed_at":"2026-08-04T15:17:40.889168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.894258Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.894258Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:e603bbdcc5d27c52251cfcde5f89f1ab0f2d4ab09b49ee1caccdb4a1982c6629","observation_id":"df78588f-6206-4996-84be-181575057466","resolution":{"observed_at":"2026-08-04T15:17:40.894258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.899211Z","title":"Degrave, F","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.899211Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:5864b346bf2ac4603b7ff0a1dedd68f29cf4569a632e56cf6fa443d4da1d989b","observation_id":"4b1e7abb-4055-446f-91e2-ee33fb0bb19d","resolution":{"observed_at":"2026-08-04T15:17:40.899211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T15:17:40.905001Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.905001Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:f7725d596f355d08ed44841f73d356487d928f524cf63b416aa728a438d9c396","observation_id":"4f25d8e3-dd32-4e81-a310-cf8d1c7cb824","resolution":{"observed_at":"2026-08-04T15:17:40.905001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.910536Z","title":"Dulac-Arnold, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.910536Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:e2cbaa710764e6d04d3f71bee63c0345fba50be38465b1c2f88956a34820a1b8","observation_id":"1c6db22e-1bfd-479a-916b-4371b0228b12","resolution":{"observed_at":"2026-08-04T15:17:40.910536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.916553Z","title":"Ghosh, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.916553Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:181128097cf383f76f19e35d465b945b012f7e286d897c2ac2383d6f57b9fdff","observation_id":"2585bacb-d440-4f3a-a92b-fbd2b039682d","resolution":{"observed_at":"2026-08-04T15:17:40.916553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.06527","last_updated":"2017-01-11T20:25:54Z","snapshot_observed_at":"2026-08-03T18:25:04.868564Z","submitted_at":"2015-07-23T15:16:46Z","title":"Deep Recurrent Q-Learning for Partially Observable MDPs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.06527","snapshot_observed_at":"2026-08-04T15:17:40.921740Z","title":"Hausknecht and P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.921740Z"},"links":{"cited_paper":"/paper/1507.06527","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:c7bb6f812ced0a8d100f07b4f0cc4d666f400416c017de9f12f3172af43c1dcb","observation_id":"f6b14c88-ba9b-497a-a7c6-182b06b9c4d0","resolution":{"observed_at":"2026-08-04T15:17:40.921740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.928240Z","title":"Hochreiter and J","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.928240Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:9acc539f586133f7ad25158861b986661441393578045a0927cbc2c4f3e8c515","observation_id":"ef9c6021-d62e-43b7-942b-174edf5bb840","resolution":{"observed_at":"2026-08-04T15:17:40.928240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.933614Z","title":"Huang, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.933614Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:67f995e82a8077abe45cecaa4d91337b2288b9a1c8ee6bf437eff6a016fda4a8","observation_id":"5215ac3d-f50d-454a-8268-db30920c14a4","resolution":{"observed_at":"2026-08-04T15:17:40.933614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.938312Z","title":"Hutter, H","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.938312Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:e72430f57042f785c75ea40892ccb56b509c677b8c705e1a41e80fc2838ab138","observation_id":"378b322d-cad9-4e9f-b14b-aba407d69a10","resolution":{"observed_at":"2026-08-04T15:17:40.938312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.943272Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.943272Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:cc1e9bef21b4d24c8081dcd9465568aef6bc1129b391543200fae4cb2f4213e4","observation_id":"680a76b8-48f7-4da3-9c56-34af51d11d90","resolution":{"observed_at":"2026-08-04T15:17:40.943272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.948352Z","title":"Cybersecurity workforce study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.948352Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:91bbba174d2daf17c61f6b8e297869f502333d8365c35902b2a39302b5f58f60","observation_id":"bbcab720-7abf-49c9-880e-57e10f2bbee0","resolution":{"observed_at":"2026-08-04T15:17:40.948352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17246","last_updated":"2023-08-18T11:32:44Z","snapshot_observed_at":"2026-07-06T15:34:09.163519Z","submitted_at":"2023-05-26T20:19:09Z","title":"NASimEmu: Network Attack Simulator & Emulator for Training Agents Generalizing to Novel Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17246","snapshot_observed_at":"2026-08-04T15:17:40.953276Z","title":"Janisch, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.953276Z"},"links":{"cited_paper":"/paper/2305.17246","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:1074c3ae0d5cd63b973a816d64d795432e0e63153e140f99269c09e364c7e410","observation_id":"be890974-ce76-426e-aa22-2ff732c5acdb","resolution":{"observed_at":"2026-08-04T15:17:40.953276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.958426Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.958426Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:7310d901ab3a3a0e178b0f59f4ae427db2b10a1b028fb23fb2ba583bba4edc2b","observation_id":"af6533b2-f4dc-4823-bb43-c3d5942094af","resolution":{"observed_at":"2026-08-04T15:17:40.958426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.963384Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.963384Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:04114c87731406a70e6cf31841f55cd9335fe094ab4645d2e9f1985d90e84eff","observation_id":"c2063417-f2a5-43e9-976b-287b76b93851","resolution":{"observed_at":"2026-08-04T15:17:40.963384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.968243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.968243Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:edb3826f47c888014cf9a426794fd05e0ad67f466a27a1007efb0c22b9835a9e","observation_id":"c686a1b8-9e5f-4370-9642-4bb3c3c3f058","resolution":{"observed_at":"2026-08-04T15:17:40.968243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.972818Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.972818Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:56398a4d0771bc19868124a5900b5717a15dc203d7877489d127d12e67ea4c73","observation_id":"2f61a012-b49e-48dd-9113-0de08caf5197","resolution":{"observed_at":"2026-08-04T15:17:40.972818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/eng2.12818","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Engineering Reports","work_id":"c2da126d-1850-401e-8229-77d7f6564b59","year":null},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.977798Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:596d19310f06a5da43db3c52767ff718e755425e2b50c510fceb6cb4c787897f","observation_id":"2c93b0e1-4c17-4d7d-9e05-c8bef29f1fdd","resolution":{"observed_at":"2026-08-04T15:19:27.934746Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.983462Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.983462Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:f13ab3528be9d69ddbb112346a537831903f224a1eec7646f502063a3921ebad","observation_id":"b934f38d-5405-43ec-8b8f-d95724659b2f","resolution":{"observed_at":"2026-08-04T15:17:40.983462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.988633Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.988633Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:03cb70354d2571faab8c9f2bc9c31488343367b19818cde890f3a8971963bcf5","observation_id":"6c7f43cd-af3a-434b-a162-697e746ec5a4","resolution":{"observed_at":"2026-08-04T15:17:40.988633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.994639Z","title":"Macaulay","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.994639Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:3858f7c2e10a2611a2ef9f0f90af009a8362d48c6c0ac4fc365f317c07fd8f80","observation_id":"d45b250d-d372-4043-bc0d-94d3ef81e9ae","resolution":{"observed_at":"2026-08-04T15:17:40.994639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.999615Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.999615Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:9547e6e5b7cef4dcc3dfacf440103c103786a4fd4fcc90d1993121b9ff178455","observation_id":"8108e6a3-2ca6-4f01-9551-16cda0bab9a1","resolution":{"observed_at":"2026-08-04T15:17:40.999615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.004504Z","title":"Technical guide to information security testing and assessment","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.004504Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:103ad57aef448b763fc36248ebf5def072df3675c5790dff5df8698f655675bf","observation_id":"c0c2d9a0-2bfb-45cb-abf1-d15ddd14a9c6","resolution":{"observed_at":"2026-08-04T15:17:41.004504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.009669Z","title":"Assessing security and privacy controls in information systems and organizations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.009669Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:8ee86fffb1f292414a6b06e44aa497d61408fd413244f2af18b576ec020b2f0c","observation_id":"da2368d6-0f5c-4b37-b418-1eb2613e3061","resolution":{"observed_at":"2026-08-04T15:17:41.009669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.014343Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.014343Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:263b8809b74daf0fda5c679d89a0babd27d2c21e428e742cfeaba056615c720d","observation_id":"e2e76536-4b41-48e8-9b76-5adb3d8f272b","resolution":{"observed_at":"2026-08-04T15:17:41.014343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.020267Z","title":"Oesch, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.020267Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:db59078c8c8677d0534249efa2820b332f7a1f6a61d92893a6194c34546280c9","observation_id":"69fc5aa4-7fba-4517-ab64-06911226b6be","resolution":{"observed_at":"2026-08-04T15:17:41.020267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.025029Z","title":"Parisotto, F","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.025029Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:c28f545f7fc3a3573777bd29551b0fa434c83a634308cf66a40e3f2f6baaaa02","observation_id":"cfb38252-9f68-4735-877f-d6edfc99939c","resolution":{"observed_at":"2026-08-04T15:17:41.025029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.030292Z","title":"Patterson, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.030292Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:eb66ed42541f5eafb5d5ba99f704ac7b9caa35e2d5974b8729b2a12be2e7e242","observation_id":"8e77b001-8872-4ab3-876b-c5520f2a1960","resolution":{"observed_at":"2026-08-04T15:17:41.030292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.035430Z","title":"Pleines, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.035430Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:048ae48795284a64dd54c26ad5c9b84207d94c9b9df3ed8f52b39e680df0daf9","observation_id":"8640583c-1f9e-4d92-85f5-58ba7cb4b885","resolution":{"observed_at":"2026-08-04T15:17:41.035430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.040622Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.040622Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:7a55ebad4ad4d1cea3cb4cf7dc117818938ae79a4ac6d85173add55abd62ad3c","observation_id":"23e55b4b-7e3b-44de-bd0a-166ae10eda40","resolution":{"observed_at":"2026-08-04T15:17:41.040622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.046211Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.046211Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:242e2298d2a1ea7b756dc5cfdf3d91e253aaccd4684ebe16686a0f81e8dfe053","observation_id":"0e4bca46-1403-4038-bf04-f51259144135","resolution":{"observed_at":"2026-08-04T15:17:41.046211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.051965Z","title":"Raffin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.051965Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:4a6b44c181f0fc0d98bd1afa06486fc9916889cac49e36bcfd3cb1562bec5a52","observation_id":"ee5c287d-6ac4-45d8-880a-15369729d2f9","resolution":{"observed_at":"2026-08-04T15:17:41.051965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.057452Z","title":"Automatedpenetrationtestingbasedonlstm and advanced curiosity exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.057452Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:01b3fdc962237e833e1a3d9fd18f1badfc561d50fcdeb83b19a0d5c6a3389c3d","observation_id":"86bd93f7-8500-41e5-8d32-b857f82b498e","resolution":{"observed_at":"2026-08-04T15:17:41.057452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.4714","last_updated":"2013-06-19T22:39:20Z","snapshot_observed_at":"2026-07-06T03:16:20.483507Z","submitted_at":"2013-06-19T22:39:20Z","title":"Penetration Testing == POMDP Solving?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.4714","snapshot_observed_at":"2026-08-04T15:17:41.062384Z","title":"Sarraute, O","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.062384Z"},"links":{"cited_paper":"/paper/1306.4714","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:1f3c68d09070bf84923b33d77276b065eca67b7d05965888fc89b7128b9d0b38","observation_id":"529d35b1-a25a-4617-b55e-90b5a857de53","resolution":{"observed_at":"2026-08-04T15:17:41.062384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.067599Z","title":"Schulman, S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.067599Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:62fc3b17f0393aafb98bd5e05bea9673767241678a0485a67c850748c4becff9","observation_id":"fad18a99-ec48-4443-8b72-943fa1d8ac6b","resolution":{"observed_at":"2026-08-04T15:17:41.067599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T15:17:41.072922Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.072922Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:53355e1cdb0dcd344877f4b861e72af6569133b6fb083241290a83ed06f52abf","observation_id":"dd98381a-f26d-48c7-a3fa-3a1cfdc6f22e","resolution":{"observed_at":"2026-08-04T15:17:41.072922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.077640Z","title":"Schwartz and H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.077640Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:ac9c5c8a482a3100372720732610329da231ad09efd20f729a3f3ae877b88179","observation_id":"1e6b992e-e622-4a17-92fb-cd232e079c4f","resolution":{"observed_at":"2026-08-04T15:17:41.077640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.082547Z","title":"Silver, J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.082547Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:f2c21fcf4d36d028f48e80acb9ebfe3eb5af7437a2e0b7f4e6dd711dc88fc094","observation_id":"2b8d6001-ed72-43a8-afbe-2dedfc2ff1a7","resolution":{"observed_at":"2026-08-04T15:17:41.082547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.09118","last_updated":"2021-08-20T11:32:23Z","snapshot_observed_at":"2026-07-06T11:40:04.439507Z","submitted_at":"2021-08-20T11:32:23Z","title":"CybORG: A Gym for the Development of Autonomous Cyber Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.09118","snapshot_observed_at":"2026-08-04T15:17:41.087188Z","title":"Standen, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.087188Z"},"links":{"cited_paper":"/paper/2108.09118","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:d93b6abe25012918d78949166896bd2db2e0f3a31c8346c3d65ad5fc70375a28","observation_id":"26c6e678-b3e7-4ae0-a20c-7523bcc2a080","resolution":{"observed_at":"2026-08-04T15:17:41.087188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.092323Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.092323Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:cf7ca9315b919855517e322b18f40c90a1febd2486aa1434b866e5e95a280eb3","observation_id":"8760bd91-8f8d-4f25-b47b-89bdc24c06ce","resolution":{"observed_at":"2026-08-04T15:17:41.092323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.096981Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.096981Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:f32a95c5f082c948a8c17c88f089ae258b2a9904aa1793265148e2519468280c","observation_id":"dfeb21ad-55d5-46ca-a2b1-bbe6dd84e728","resolution":{"observed_at":"2026-08-04T15:17:41.096981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.101651Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.101651Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:b0ad0c5b62cb5287e55ff5e7b3b6c343a4fe5c99e96f6fddc1023f3dc73fb7b7","observation_id":"8b5d5ef6-d802-406b-98c4-fa6f8de25d0f","resolution":{"observed_at":"2026-08-04T15:17:41.101651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.106454Z","title":"Terranova, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.106454Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:ccf172ba4acc654b34b66acd115281a8022a57cd8ca74e1c6273f139f6e6d47f","observation_id":"abe9022e-9c4f-40b7-8417-a9dd012a201a","resolution":{"observed_at":"2026-08-04T15:17:41.106454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.112986Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.112986Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:5b19dddd182dc7097785fd6d7244dd4918063268cd81323f5d901a141f22d5c5","observation_id":"7c050729-9864-4b22-a692-59ada23c098e","resolution":{"observed_at":"2026-08-04T15:17:41.112986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.117933Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.117933Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:99a260014ea12ff6d057487e319ddcaa01522521c60884396c621120ebc7d629","observation_id":"7bb3ba7d-f30e-4797-9a28-dba28c9705b4","resolution":{"observed_at":"2026-08-04T15:17:41.117933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.124022Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.124022Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:df9c6f9735df500e0c5ff94d47321e8114fb7105bc2d61e678dd264d27df6d8b","observation_id":"487e9c21-ba1f-43ad-b643-bf34232ef265","resolution":{"observed_at":"2026-08-04T15:17:41.124022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.129479Z","title":"Global cybersecurity outlook 2023.Insight Report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.129479Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:7f3072f24752daf157b69efa88c8e996764e6d0428a052fa1e1973790aaf8a66","observation_id":"9f2d09b9-074d-4cff-b24c-0035460a1dd3","resolution":{"observed_at":"2026-08-04T15:17:41.129479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.136192Z","title":"Yang and X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.136192Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:fba59b25b4689ac8e646d69a72f896d76129a4b666c768035613597acfafdc2f","observation_id":"c2b508a2-308e-4114-83f9-8d00c3a7b74b","resolution":{"observed_at":"2026-08-04T15:17:41.136192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.06893","last_updated":"2018-04-20T16:49:52Z","snapshot_observed_at":"2026-08-04T06:10:10.723883Z","submitted_at":"2018-04-18T19:49:13Z","title":"A Study on Overfitting in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.06893","snapshot_observed_at":"2026-08-04T15:17:41.150060Z","title":"Zhang, O","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.150060Z"},"links":{"cited_paper":"/paper/1804.06893","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:b02339afacc2432a37795301b3cb3345ee5c7c2b5d437d3e89a3265ee10a262e","observation_id":"9cb9216d-e9d0-460d-b1e8-06268bc07c28","resolution":{"observed_at":"2026-08-04T15:17:41.150060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.155716Z","title":"Zhang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.155716Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:d94dda828ec763e88b66fffadb7b4c8cf82f30d136739b3058d16d5ee66e5ba2","observation_id":"284a1faa-5b62-4786-8ad5-0b3198941490","resolution":{"observed_at":"2026-08-04T15:17:41.155716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.160405Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.160405Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:c3ecff8dcb2c72c14f072a82420f8dc44d746244f2bce6b1f20ea2599c03c33e","observation_id":"77f777e9-2310-46b4-93b4-2084c75bc8be","resolution":{"observed_at":"2026-08-04T15:17:41.160405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.165469Z","title":"23 Table 2: Hyperparameter search ranges for PPO, PPO-FS and PPO-AO","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.165469Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:f0036dd844abcc8da08afa1749c5c4a20d6aa1059bb238740e02e78aa0926364","observation_id":"2a46e996-baa1-454e-a247-bbf80bf5a09a","resolution":{"observed_at":"2026-08-04T15:17:41.165469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10630","last_updated":"2022-02-22T02:34:16Z","snapshot_observed_at":"2026-08-02T20:52:12.697422Z","submitted_at":"2022-02-22T02:34:16Z","title":"Behaviour-Diverse Automatic Penetration Testing: A Curiosity-Driven Multi-Objective Deep Reinforcement Learning Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10630","snapshot_observed_at":"2026-08-04T15:17:41.144781Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.144781Z"},"links":{"cited_paper":"/paper/2202.10630","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:0eb83ed8a78d458f8dd8e2aab1b60c3464adfcae48f541ca4dc50c1e0d1b4018","observation_id":"f9f3d008-a026-4ce2-8099-b3a8898ef15b","resolution":{"observed_at":"2026-08-04T15:17:41.144781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.302535Z","title":"The specific version we used for thestable-baselines3 framework is 2.4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":7602,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.302535Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:06f54952b535caec803353f47e13ae0c827a0f716b292acf89b852dd527447d0","observation_id":"cf8f1b00-68f3-4d41-872b-3c835127b37a","resolution":{"observed_at":"2026-08-04T15:17:41.302535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T21:36:02.502268Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2509.20008."}