{"as_of":"2026-08-11T10:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c39cce7c9f4d7f50c5e4867f4847c132daff3969bffee15e7d094b5afb5261c2","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:20:01.500799Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.05501/citation-record","integrity":"/paper/2501.05501/integrity","json":"/paper/2501.05501/citation-record.json","paper":"/paper/2501.05501"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.06038","last_updated":"2020-02-14T13:57:22Z","snapshot_observed_at":"2026-07-06T08:57:20.804732Z","submitted_at":"2020-02-14T13:57:22Z","title":"Never Give Up: Learning Directed Exploration Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06038","snapshot_observed_at":"2026-08-10T21:20:01.400140Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.400140Z"},"links":{"cited_paper":"/paper/2002.06038","citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:9a87eb3c2ef07f62e2071923e43be486b5aa53a042bf07416e356ebf8fb87762","observation_id":"0b0f7a53-54a8-4bcd-b3be-61cd51e7b03c","resolution":{"observed_at":"2026-08-10T21:20:01.400140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-09T23:24:21.399948Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T21:20:01.406481Z","title":"Brockman, V","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.406481Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:47e1e95b46b1f90fc27274b379740b1b6c7d20c0a32bfe2ac9d6bc7ccb79a28a","observation_id":"5b3bc92a-e2ae-4d1f-ae4b-7f916ae0e398","resolution":{"observed_at":"2026-08-10T21:20:01.406481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.412153Z","title":"Brown and T","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.412153Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:b00d4eb25d259264720d4d03dd9e9136ec0a629dc3ad120172fa9082e5590a1b","observation_id":"96f02a0f-43f7-4ea9-9b63-4ec2c605b1c2","resolution":{"observed_at":"2026-08-10T21:20:01.412153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.418213Z","title":"Brown and T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.418213Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:58fd5de4d5c839fd46ef6d0467787523e1e550d2405797709a86a49dfa653dbc","observation_id":"9c5ad7fb-b1d6-48a7-8f75-2530a001e4cb","resolution":{"observed_at":"2026-08-10T21:20:01.418213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.820423Z","title":"Dietterich","venue":null,"work_id":"806e5d20-5d53-45d6-9995-c26a33268a52","year":2000},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.423972Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:fa5364e54ffcc5a6a61b5870c276475254645b54745dba6dde0c8cf2d52eefee","observation_id":"4387aa5f-df0a-4520-a506-5d6d572db801","resolution":{"observed_at":"2026-08-10T21:20:01.825165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1507.06527","last_updated":"2017-01-11T20:25:54Z","snapshot_observed_at":"2026-08-09T10:33:19.055285Z","submitted_at":"2015-07-23T15:16:46Z","title":"Deep Recurrent Q-Learning for Partially Observable MDPs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.06527","snapshot_observed_at":"2026-08-10T21:20:01.429083Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.429083Z"},"links":{"cited_paper":"/paper/1507.06527","citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:a36e8ca2fd688bebfa410e6cd1137812fa8a7d57d524d6cfa761e0aa9a59763f","observation_id":"353d1950-63f9-4b0b-bacd-0b98ae2168e8","resolution":{"observed_at":"2026-08-10T21:20:01.429083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.434743Z","title":"Hochreiter and J","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.434743Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:47eb2ede8697cf4cc67043a60397a6139ec2fb096d32d3f34c3be9249e76e904","observation_id":"7134c656-60c3-436d-9273-2643819e0329","resolution":{"observed_at":"2026-08-10T21:20:01.434743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.804136Z","title":null,"venue":null,"work_id":"45f532b6-638c-4426-91bd-ee283ab5524f","year":2018},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.439472Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:caf8c6ebc16ac8efe34e6e889694044fa3f29111626285865de1c0d71b323e5a","observation_id":"22847d35-5279-4f1a-92bd-16e6a63b1977","resolution":{"observed_at":"2026-08-10T21:20:01.809236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.786763Z","title":"Jaakkola, M","venue":null,"work_id":"732e3c26-2ffa-4e63-9575-efa625c56fc4","year":1994},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.444126Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:bb44d069d41f23bfe0a94c213ddc575e5b65ab548049f82121e35fbf224b5c30","observation_id":"09188085-a1a5-41f1-83ea-699c165066e5","resolution":{"observed_at":"2026-08-10T21:20:01.792040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.766671Z","title":"Juozapaitis, A","venue":null,"work_id":"a4ca5da6-c1ab-471e-a4fd-0a465db244be","year":2019},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.448926Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:0a28e8c2cca2753eed3e8327677da443eb464728c08e377a3ef4aa041c87f257","observation_id":"af2a37f1-e073-4d29-9beb-e8beaba00405","resolution":{"observed_at":"2026-08-10T21:20:01.772961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.750331Z","title":"Karlsson","venue":null,"work_id":"5b383063-004e-489b-bd6b-913675042ffe","year":1994},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.454330Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:8b109d41a7c65fb90f5c788f2a11b091810ccec4eff8382875a73305a0c2d047","observation_id":"59d64928-dbf3-4040-9f88-f8c5abfd838f","resolution":{"observed_at":"2026-08-10T21:20:01.754630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-10T21:20:01.459523Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.459523Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:0bbbc7660074b6332c14b3bacdce5bae362bc249844319a2d58930c402aa639a","observation_id":"ed44d714-c9fe-4cc4-a7b9-e42c80817f31","resolution":{"observed_at":"2026-08-10T21:20:01.459523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.734285Z","title":null,"venue":null,"work_id":"0a900f1c-4009-4d74-be56-ea477d0cf6b3","year":2003},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.465238Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:42e547dbf226386fed0f2d7d531dbb7b7f4fed88486d340f1ca9ca38bbc77e6f","observation_id":"4ca63208-5a39-437a-8245-0b4eef556b3f","resolution":{"observed_at":"2026-08-10T21:20:01.738730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/e24060774","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.544677Z","title":null,"venue":null,"work_id":"a170d8b1-3f1a-4ecb-87de-89f56b20ab8d","year":2022},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.470221Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:aea1f4de9cec3c18fd6f702949aea689c6f0d6516606423886d6127ee639366a","observation_id":"8416c1d6-f018-4c69-8693-b0bf36f10b97","resolution":{"observed_at":"2026-08-10T21:20:01.550257Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.718666Z","title":null,"venue":null,"work_id":"41833929-6ecb-4b0d-82de-edb0c31ecd40","year":2018},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.475461Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:b1d0f1a73d40d091c6af04a28c9c14e90b6c7db95d8e093e7dcb8402f33af2f8","observation_id":"cb072f77-52b8-4b67-bafb-2735f4b3cea1","resolution":{"observed_at":"2026-08-10T21:20:01.723608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.701942Z","title":null,"venue":null,"work_id":"bd61a4f6-9cdc-4ddf-a3b8-08e1c2118724","year":2018},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.480560Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:cabcac5cbcccc29bdc53a4af1290f8cd1cade74b8b32805f85dbd7f2281cb123","observation_id":"cd345702-7763-42ca-b332-6ecaaa48dbed","resolution":{"observed_at":"2026-08-10T21:20:01.707576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.685769Z","title":null,"venue":null,"work_id":"322ac138-22b2-49e0-9d35-f95554e900d9","year":1994},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.485378Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:ee21efe17df4b09ba36bbd170df25e16d3d9f16bcc5c3fa16090d39f328e233c","observation_id":"f324169c-03ed-4096-8f9f-fd7393fb20ce","resolution":{"observed_at":"2026-08-10T21:20:01.690780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04208","last_updated":"2017-11-28T04:15:00Z","snapshot_observed_at":"2026-07-06T05:46:43.820045Z","submitted_at":"2017-06-13T18:05:48Z","title":"Hybrid Reward Architecture for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04208","snapshot_observed_at":"2026-08-10T21:20:01.490092Z","title":"van Seijen, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.490092Z"},"links":{"cited_paper":"/paper/1706.04208","citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:4aa50aace7405c04daa19e3f75268f951be3862b63f444e6d280b48ae988e460","observation_id":"55632a50-b590-42cd-b58f-ec5c5c28b98a","resolution":{"observed_at":"2026-08-10T21:20:01.490092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.495703Z","title":"Vinyals, I","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.495703Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:40bdde5f57422e01209ecdf7eb9a27e78fc5277890bd8420ecefc103306e3938","observation_id":"b84584a4-f9ca-4dae-b5f8-b56e23fd1925","resolution":{"observed_at":"2026-08-10T21:20:01.495703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:20:01.500799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T21:20:01.500799Z"},"links":{"citing_paper":"/paper/2501.05501"},"observation_digest":"sha256:892ffca723fcd24fbe44dda642bc68a5ae44efca371b9bbeaeef45f42c57b8de","observation_id":"d720c3d6-e188-43ad-8953-50f1a06cea0e","resolution":{"observed_at":"2026-08-10T21:20:01.500799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.05501","last_updated":"2025-01-20T22:06:19Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T21:11:49.144848Z","submitted_at":"2025-01-09T18:43:05Z","title":"Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2501.05501."}