{"as_of":"2026-08-20T11:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96bdfcc650f270d3ff1233f71f6c766c825c34c4cfa3d3935382b4ee8626fbe5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:37:43.440877Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:39:41.546939Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-12T16:43:54.097758Z","title":"A closer look at invalid action masking in policy gradient algorithms,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15212","last_updated":"2024-11-20T12:11:12Z","snapshot_observed_at":"2026-08-19T12:31:26.039531Z","submitted_at":"2024-11-20T12:11:12Z","title":"Effective Analog ICs Floorplanning with Relational Graph Neural Networks and Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:43:54.097758Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2411.15212"},"observation_digest":"sha256:cf6c669c125c2a72dad00dc734d957024c70abf7470ecfd4b209769332f8c03f","observation_id":"652b256a-eaaf-4233-94de-631fc1e5f332","resolution":{"observed_at":"2026-08-12T16:43:54.097758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-12T10:20:45.751735Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.19359","last_updated":"2024-11-28T20:09:12Z","snapshot_observed_at":"2026-08-17T23:12:42.617034Z","submitted_at":"2024-11-28T20:09:12Z","title":"Integrating Transit Signal Priority into Multi-Agent Reinforcement Learning based Traffic Signal Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:20:45.751735Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2411.19359"},"observation_digest":"sha256:75f090d56e5d4c44ce58b005351f56db776b597af65a84b2f66da364f0b6e388","observation_id":"810ba853-4e80-4603-a081-6ade4818f69b","resolution":{"observed_at":"2026-08-12T10:20:45.751735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-11T21:39:11.945279Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-16T06:22:28.382009Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.945279Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:c86e842d57b9b2b197d21f3838b56df9d1f3a932077eedbd1f9c432ea178f9a3","observation_id":"c50f1d80-fa3f-41ac-af74-e2ad62556fc9","resolution":{"observed_at":"2026-08-11T21:39:11.945279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-07T04:07:48.369414Z","title":"A closer look at invalid action masking in policy gradient algorithms,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.11723","last_updated":"2025-06-13T12:37:26Z","snapshot_observed_at":"2026-08-17T21:48:12.365421Z","submitted_at":"2025-06-13T12:37:26Z","title":"Dynamic Collaborative Material Distribution System for Intelligent Robots In Smart Manufacturing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:48.369414Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2506.11723"},"observation_digest":"sha256:0ac57161fce85d874f41545fdbd1da7edc8a85b76f8d6c95783ab17024b69914","observation_id":"3793f95a-11f8-46cf-86c2-36f4bc144295","resolution":{"observed_at":"2026-08-07T04:07:48.369414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-06T23:48:53.981879Z","title":"Huang, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16352","last_updated":"2025-06-19T14:29:48Z","snapshot_observed_at":"2026-08-19T15:11:31.567167Z","submitted_at":"2025-06-19T14:29:48Z","title":"Data-Driven Policy Mapping for Safe RL-based Energy Management Systems","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:53.981879Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2506.16352"},"observation_digest":"sha256:4e140de222102f41a88bde141dc7533d312732142f4d13532bbe66ca7b2bf1b1","observation_id":"53be11a9-015f-4c00-9348-8634fb2cef0c","resolution":{"observed_at":"2026-08-06T23:48:53.981879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-06T15:12:00.444992Z","title":"A closer look at invalid action masking in policy gradient algorithms,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.16635","last_updated":"2025-07-22T14:34:36Z","snapshot_observed_at":"2026-08-18T07:45:37.365023Z","submitted_at":"2025-07-22T14:34:36Z","title":"Novel Multi-Agent Action Masked Deep Reinforcement Learning for General Industrial Assembly Lines Balancing Problems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:12:00.444992Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2507.16635"},"observation_digest":"sha256:68cfdffcdaa870968ec4e2f9728e9ce9481cb5655ac3060d66c772992947a874","observation_id":"07e50d5f-b39a-42f3-8389-29f39ca7fc18","resolution":{"observed_at":"2026-08-06T15:12:00.444992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-15T17:23:21.079193Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.13070","last_updated":"2025-08-18T16:42:55Z","snapshot_observed_at":"2026-08-15T17:13:41.025960Z","submitted_at":"2025-08-18T16:42:55Z","title":"Reinforced Context Order Recovery for Adaptive Reasoning and Planning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:23:21.079193Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2508.13070"},"observation_digest":"sha256:7d0c0f5a30106abba7eeb6405c4aae8e99c00c4828d8b4f1dd175019f7cbfb4e","observation_id":"5f748538-feec-4615-9928-e9c37290ccb1","resolution":{"observed_at":"2026-08-15T17:23:21.079193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-15T17:37:43.440877Z","title":", author Onta \\ n \\'o n, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.20102","last_updated":"2025-08-12T03:10:06Z","snapshot_observed_at":"2026-08-18T15:28:38.018085Z","submitted_at":"2025-08-12T03:10:06Z","title":"A Hierarchical Signal Coordination and Control System Using a Hybrid Model-based and Reinforcement Learning Approach","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:37:43.440877Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2508.20102"},"observation_digest":"sha256:52982b85c17d6d05752a8b04753fde12006baba91129be87eb78f1ea6b932d83","observation_id":"cbbb56f0-4485-47d6-b0bd-f13aa40aa6e1","resolution":{"observed_at":"2026-08-15T17:37:43.440877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-05T14:32:07.511541Z","title":"Masked reinforcement learning with action masking,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.21272","last_updated":"2025-08-29T00:27:03Z","snapshot_observed_at":"2026-08-19T05:28:28.717792Z","submitted_at":"2025-08-29T00:27:03Z","title":"Learning to Assemble the Soma Cube with Legal-Action Masked DQN and Safe ZYZ Regrasp on a Doosan M0609","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:07.511541Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2508.21272"},"observation_digest":"sha256:c5b1fa3c7f6bd7e2807098e5d615a01a5e325381743753feb245dc6f33ec6868","observation_id":"d0ad9eb3-73f8-444f-8359-c85db362407c","resolution":{"observed_at":"2026-08-05T14:32:07.511541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-05T12:46:46.718720Z","title":"A closer look at invalid action masking in policy gradient algorithms,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.10499","last_updated":"2025-09-01T08:53:04Z","snapshot_observed_at":"2026-08-12T19:58:03.622218Z","submitted_at":"2025-09-01T08:53:04Z","title":"Towards Scalable O-RAN Resource Management: Graph-Augmented Proximal Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:46:46.718720Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2509.10499"},"observation_digest":"sha256:503e451f1fa9ee57247849d123e46f7aee7e50fa0351ede0f3127fc5bbe191df","observation_id":"fe0e8f53-bd8b-43a7-9692-8648a2b0ea01","resolution":{"observed_at":"2026-08-05T12:46:46.718720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":"2006.14171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-07-04T08:39:41.546939Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":"7eb312f8-a8f3-4a85-bc2c-93fd2b578dd3","year":2006},"citing_paper":{"arxiv_id":"2604.24501","last_updated":"2026-05-03T04:46:35Z","snapshot_observed_at":"2026-08-02T06:04:17.459335Z","submitted_at":"2026-04-27T14:04:55Z","title":"TARMM: Scaling Delay-Critical Edge AI Offloading in 5G O-RAN via Temporal Graph Mobility Management","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T01:25:48.075081Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2604.24501"},"observation_digest":"sha256:9a2e00dc5d2237ef3ed12cd9e1a1ea086f00815a7dc51562d7185ee0d6b43ecf","observation_id":"b0b57996-e29b-451e-8ec2-88e49c4e411e","resolution":{"observed_at":"2026-05-11T23:11:14.767914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":"2006.14171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-07-04T08:39:41.546939Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":"7eb312f8-a8f3-4a85-bc2c-93fd2b578dd3","year":2006},"citing_paper":{"arxiv_id":"2605.01025","last_updated":"2026-05-01T18:37:58Z","snapshot_observed_at":"2026-08-15T08:58:28.665339Z","submitted_at":"2026-05-01T18:37:58Z","title":"Your Loss is My Gain: Low Stake Attacks on Liquid Staking Pools","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-09T17:57:37.260492Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2605.01025"},"observation_digest":"sha256:8d8807ef96b1b9f62d22180abd38f12d58b8a6f68029e3de3789854321b3c370","observation_id":"0a71177f-d0ee-4528-9be5-39d1d5221667","resolution":{"observed_at":"2026-05-11T16:16:11.282290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":"2006.14171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-07-04T08:39:41.546939Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":"7eb312f8-a8f3-4a85-bc2c-93fd2b578dd3","year":2006},"citing_paper":{"arxiv_id":"2605.11375","last_updated":"2026-05-12T00:58:42Z","snapshot_observed_at":"2026-08-13T02:59:20.694396Z","submitted_at":"2026-05-12T00:58:42Z","title":"TuniQ: Autotuning Compilation Passes for Quantum Workloads at Scale for Effectiveness and Efficiency","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T02:50:20.040271Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2605.11375"},"observation_digest":"sha256:91e244c7f8e75b37bab8cb48b5683adc1a4eca8dcc7ffa2ce585d166fc3dcbba","observation_id":"4f5e053d-38c2-49ea-9cfe-528aecb8588a","resolution":{"observed_at":"2026-05-13T02:52:08.808054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":"2006.14171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-07-04T08:39:41.546939Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":"7eb312f8-a8f3-4a85-bc2c-93fd2b578dd3","year":2006},"citing_paper":{"arxiv_id":"2605.15236","last_updated":"2026-05-22T22:27:15Z","snapshot_observed_at":"2026-08-16T03:49:45.913832Z","submitted_at":"2026-05-13T22:18:30Z","title":"Learning Selective Merge Policies for Deadline-Constrained Coded Caching via Deep Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T17:26:04.762451Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2605.15236"},"observation_digest":"sha256:4dfdb34e3ec761573adfc9ffbcf83cbf7229ed8f9d93ea96ff58930b0495f198","observation_id":"6a89b502-5468-4592-97a4-a75c77dbc6b8","resolution":{"observed_at":"2026-05-19T17:27:41.299409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":"2006.14171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-07-04T08:39:41.546939Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":"7eb312f8-a8f3-4a85-bc2c-93fd2b578dd3","year":2006},"citing_paper":{"arxiv_id":"2605.15236","last_updated":"2026-05-22T22:27:15Z","snapshot_observed_at":"2026-08-16T03:49:45.913832Z","submitted_at":"2026-05-13T22:18:30Z","title":"Learning Selective Merge Policies for Deadline-Constrained Coded Caching via Deep Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T21:08:47.084947Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2605.15236"},"observation_digest":"sha256:b73398cc7de6e8164a9022da00b310ff488c5e0f143602f4cd9bf082c2ac583c","observation_id":"7f968414-1195-4db5-977e-e03a6be706bb","resolution":{"observed_at":"2026-06-30T21:15:04.608625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":"2006.14171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-07-04T08:39:41.546939Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":"7eb312f8-a8f3-4a85-bc2c-93fd2b578dd3","year":2006},"citing_paper":{"arxiv_id":"2605.28730","last_updated":"2026-05-27T16:48:55Z","snapshot_observed_at":"2026-08-12T13:11:54.096379Z","submitted_at":"2026-05-27T16:48:55Z","title":"AlphaTransit: Learning to Design City-scale Transit Routes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T11:55:20.454865Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2605.28730"},"observation_digest":"sha256:1861e80a79aec9c0da8ecf6dd06db6954e0e06d2574ea87f14467e0396a46ace","observation_id":"67e32243-3306-42fd-971d-72c4e23371c6","resolution":{"observed_at":"2026-06-29T12:03:24.317535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":"2006.14171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-07-04T08:39:41.546939Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":"7eb312f8-a8f3-4a85-bc2c-93fd2b578dd3","year":2006},"citing_paper":{"arxiv_id":"2606.10979","last_updated":"2026-06-09T15:15:21Z","snapshot_observed_at":"2026-08-16T06:47:09.367421Z","submitted_at":"2026-06-09T15:15:21Z","title":"Bellman-Taylor Score Decoding for Markov Decision Processes with State-Dependent Feasible Action Sets","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T13:36:53.866075Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2606.10979"},"observation_digest":"sha256:c0d805020809aadbd4317862c49a04158ed0ee58ed21b5ff2f0fd32d337795c8","observation_id":"7293490f-2098-479d-9857-e34000b2ab40","resolution":{"observed_at":"2026-07-03T04:47:38.596865Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":"2006.14171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-07-04T08:39:41.546939Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":"7eb312f8-a8f3-4a85-bc2c-93fd2b578dd3","year":2006},"citing_paper":{"arxiv_id":"2606.22159","last_updated":"2026-06-20T17:33:48Z","snapshot_observed_at":"2026-08-12T14:33:32.519831Z","submitted_at":"2026-06-20T17:33:48Z","title":"Deep RL for Fast Long-Horizon Operations Scheduling on NASA's Carruthers Geocorona Observatory Mission","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T11:25:57.471803Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2606.22159"},"observation_digest":"sha256:ce3b979621b807f7be30209e0de5c8a93177186a7fae697753ded7f4cc1a6d90","observation_id":"a3538820-553e-4d4c-ae3c-5905c9db9c56","resolution":{"observed_at":"2026-07-04T08:39:41.548227Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-07-30T17:40:25.172202Z","title":"arXiv preprint arXiv:2006.14171 , year=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.23617","last_updated":"2026-07-26T11:49:23Z","snapshot_observed_at":"2026-08-13T13:34:03.699530Z","submitted_at":"2026-07-26T11:49:23Z","title":"Optimal Reward Shaping: Autonomous Car Parking Case Study","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-30T17:40:25.172202Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2607.23617"},"observation_digest":"sha256:c8711c3a177d77d5c29bdebc057a3750d48a5d26b48e1b0b39e0a0f685eb25ad","observation_id":"934b253b-b71e-4296-9722-fe10141e3034","resolution":{"observed_at":"2026-07-30T17:40:25.172202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-15T15:13:06.990618Z","title":"arXiv preprint arXiv:2006.14171 , year=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.01303","last_updated":"2026-08-02T15:12:58Z","snapshot_observed_at":"2026-08-18T04:28:30.293073Z","submitted_at":"2026-08-02T15:12:58Z","title":"AlphaG-OPD: Reliability-Gated Sibling Counterfactuals for On-Policy Distillation in Symbolic Alpha Factor Discovery","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T15:13:06.990618Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2608.01303"},"observation_digest":"sha256:a0dfc34a3466b4a3be4b89b28afcebdaa632a7871d7d2b3a76e689f71ea8587d","observation_id":"244ead7a-3a31-461e-aa01-b6ae85d09cb4","resolution":{"observed_at":"2026-08-15T15:13:06.990618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2006.14171/citation-record","integrity":"/paper/2006.14171/integrity","json":"/paper/2006.14171/citation-record.json","paper":"/paper/2006.14171"},"outbound":[],"paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T19:58:15.318249Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2006.14171."}