{"as_of":"2026-08-10T12:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e86cc0ac094884f5073d927e40bb70178d94eb61bef0699d342c46237dc50cc","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T22:01:21.826493Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.21464/citation-record","integrity":"/paper/2604.21464/integrity","json":"/paper/2604.21464/citation-record.json","paper":"/paper/2604.21464"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human -level control through deep reinforcement learning","venue":null,"work_id":"1219f2f9-2d03-4d8b-999f-c991ff9f17aa","year":2015},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:ce766adcfe9f4d2c499e4f89abc3a97eaa10df13361e7921f761cbac1889d5fa","observation_id":"b0841072-eb51-41bf-82b6-079d528f6e56","resolution":{"observed_at":"2026-05-23T15:15:41.125110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering the game of Go with deep neural networks and tree search","venue":null,"work_id":"572c043e-1f96-44ab-a1a4-b4d397a173ae","year":2016},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:9de1835a7bae07d31cd6fbebe32e7a9619cac3d54c3c1585c2e8ded9db070fb9","observation_id":"46b636fd-f7d9-4a18-9378-c45f3482a4ea","resolution":{"observed_at":"2026-05-23T15:15:41.146492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":"2779fa09-b88b-45b0-be35-8c75609ed50e","year":1992},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:4f5739fe4008cfcaeedee3f4aef5388501c5cc2db642641ec5139db316088f28","observation_id":"ca323e17-2b27-49e0-9cd5-0b4a22a20f01","resolution":{"observed_at":"2026-05-23T15:15:41.131435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The neural basis of decision making","venue":null,"work_id":"ca4681f1-a098-4648-a4c9-2609789c1ad9","year":2007},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:52a9991f2e7516b425317ded627b3800f5772feceb30b64edc2b838e512eefb5","observation_id":"4c46d430-a8c8-4f4e-a5f5-2685776fec45","resolution":{"observed_at":"2026-05-23T15:15:41.134860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Probabilistic decision making by slow reverberation in cortical circuits","venue":null,"work_id":"7473f0fa-e20e-42ac-a337-ddd581f0eece","year":2002},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:77f902dc270a310009b997b13379b6b8b7c990cba9229bb433e1436562fb019a","observation_id":"3d40533a-2eee-4f33-9112-3d60497b6bc5","resolution":{"observed_at":"2026-05-23T15:15:41.142723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural correlates of evidence accumulation in a perceptual decision task","venue":null,"work_id":"acedebbf-e5ab-43d8-9346-bb6af84a5860","year":2011},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:bbb3c61c974c351ee1dc999050ec2568935f657ac0c595f2750c90f1c0b6e029","observation_id":"130c8a4e-d2e0-4dc7-b3b5-c468a1ce03a6","resolution":{"observed_at":"2026-05-23T15:15:41.121672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evidence accumulation detected in BOLD signal using slow perceptual decision making","venue":null,"work_id":"89f88087-6e6e-4ab7-820b-a360aeec0e99","year":2017},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:2f9c0771cac5ef78747aad5dd173c2bf6330a3159632d14851f16ec883bee84d","observation_id":"fa895780-f8e7-48bc-83b9-792ba508da39","resolution":{"observed_at":"2026-05-23T15:15:41.118194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04571","last_updated":"2020-01-13T23:57:28Z","snapshot_observed_at":"2026-08-06T15:50:17.165476Z","submitted_at":"2020-01-13T23:57:28Z","title":"Unifying and generalizing models of neural dynamics during decision-making","version":1},"cited_work":{"arxiv_id":"2001.04571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2001.04571","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying and generalizing models of neural dynamics during decision-making","venue":null,"work_id":"64249211-bdd6-4028-9410-d8a979a5e65b","year":2001},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"cited_paper":"/paper/2001.04571","citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:c9c1167bb62e613ccba347dac6126e46482849b49e2ba387ae140a6c849e61a9","observation_id":"357d8633-dedd-47f0-91ea-f3623a57a441","resolution":{"observed_at":"2026-05-11T14:21:05.522791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-time recurrent reinforcement learning","venue":null,"work_id":"2a905968-580b-44f4-9165-ea57c27d1e40","year":2025},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:25357a24b59b882626d491392c4671de46c2e025aefc3527df9c51d28ceed364","observation_id":"911d944e-3d32-4dba-a819-180218596201","resolution":{"observed_at":"2026-05-23T15:15:41.083563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous -time on -policy neural reinforcement learning of working memory tasks","venue":null,"work_id":"d951cf1b-8220-446e-8fdf-35e01f592e58","year":2015},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:07c7e0562b833d3b8315ed62a09f6e28ab71a8916074069044d54f74c5b07685","observation_id":"657e41f6-b68d-41a6-824f-bae00bd7de73","resolution":{"observed_at":"2026-05-23T15:15:41.101754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15292","last_updated":"2024-12-19T07:20:03Z","snapshot_observed_at":"2026-08-05T23:36:55.439875Z","submitted_at":"2024-12-19T07:20:03Z","title":"Deep reinforcement learning with time-scale invariant memory","version":1},"cited_work":{"arxiv_id":"2412.15292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15292","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning with time -scale invariant memory","venue":null,"work_id":"6cf5def3-c12a-41c8-8589-38efae34d198","year":2024},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"cited_paper":"/paper/2412.15292","citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:8327ab04f42cbb8cbe306fc8332dad3b3d1262b951020d3d7158fde0f52c6d78","observation_id":"4b007fa9-f9c7-477d-9e98-c406e616fa68","resolution":{"observed_at":"2026-05-11T14:21:05.555777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi -timescale memory dynamics extend task repertoire in a reinforcement learning network with attention -gated memory","venue":null,"work_id":"1fcc7ce9-09ec-46f6-a0b7-41cc7c42da5a","year":2018},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:658ffe24d916562c0868b3cb6fe4588523caea47bdbe2924d7ace1458d9fa761","observation_id":"28c2bfd4-0b19-4191-af5a-1fccc1acb1bf","resolution":{"observed_at":"2026-05-23T15:15:41.091214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non -stationary policy learning for multi-timescale multi -agent reinforcement learning","venue":null,"work_id":"804dd440-80b3-4c47-ac74-b91a726a1805","year":2023},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:3f33012bda8f5aa0c8955bd81fcd505a19539c39cf6e9ff4ab0124146e9c5626","observation_id":"45021147-b9d9-4667-b059-861249a29d97","resolution":{"observed_at":"2026-05-23T15:15:41.088169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09466","last_updated":"2023-06-15T19:37:43Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T19:37:43Z","title":"Simplified Temporal Consistency Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2306.09466","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09466","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simplified temporal consistency reinforcement learning","venue":null,"work_id":"4150522e-773a-4331-8ab9-1fbd3e9a0f93","year":2023},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"cited_paper":"/paper/2306.09466","citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:559a1ae7403879d8cc2701456637a9bca9b935455e007c13470c14ebadb14c4a","observation_id":"b8054ab1-5b5a-4ef2-8415-edf7a329106c","resolution":{"observed_at":"2026-05-11T14:21:05.547354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploiting multiple secondary reinforcers in policy gradient reinforcement learning","venue":null,"work_id":"9a12964a-bd61-4d1e-afca-a38ab0e64467","year":2001},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:9946c6ab3e1a2cbbe1e9a5213d56053f8915f7d471e8a5aaec4d59e2d581d839","observation_id":"0aab9c72-a295-4d2f-963e-4d1cdc3ef677","resolution":{"observed_at":"2026-05-23T15:15:41.098206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The diffusion decision model: theory and data for two-choice decision tasks","venue":null,"work_id":"49abb441-0e6d-4216-8fc7-4d7e6f813d7c","year":2008},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:806f366e9da4979c905dbd92dbec39b2be367c5adc9769bcc3f4646ac9782a7b","observation_id":"6c9360b7-5c19-4312-833e-84d49f574447","resolution":{"observed_at":"2026-05-23T15:15:41.107344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The physics of optimal decision making: a formal analysis of models of performance in two -alternative forced-choice tasks","venue":null,"work_id":"9495906e-d2a1-464a-a8e6-d6075169c116","year":2006},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:67152e99729d35c2fbcf7fe8f577ea017e56fb9e75d43decf2f99d066d65cfdb","observation_id":"78e26003-2031-48b0-b1ee-198094ca00e9","resolution":{"observed_at":"2026-05-23T15:15:41.080027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural basis of a perceptual decision in the parietal cortex (area LIP) of the rhesus monkey","venue":null,"work_id":"928e90da-4457-40af-9a9c-568b5c3ec4e3","year":2001},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:07a4dd368da73cfcd7078f93e7f682ad0a20219f567c2ce47c01fb3db56eb676","observation_id":"bfbf78a2-a927-45a5-8070-8da1f8726779","resolution":{"observed_at":"2026-05-23T15:15:41.076178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Response of neurons in the lateral intraparietal area during a combined visual discrimination reaction time task","venue":null,"work_id":"07530765-f18f-405f-b0d4-2408033c65d7","year":2002},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:606ecb4e68348bbcd69e71aebb436a9d7673abf01fb78043c0d832b723f9cfcb","observation_id":"98e1a712-432d-4f6a-992f-ce84a74f9ee2","resolution":{"observed_at":"2026-05-23T15:15:41.094637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward-based training of recurrent neural networks for cognitive and value-based tasks","venue":null,"work_id":"0645f382-5945-4e87-b975-215ac57d6239","year":2017},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:fc47d5dc72543a59a1eee37fa6ed25fc71422061aea872a62c1f4ef889650563","observation_id":"52f965d8-da2b-47d5-bb2f-a41bc3eea513","resolution":{"observed_at":"2026-05-23T15:15:41.137803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context-dependent computation by recurrent dynamics in prefrontal cortex","venue":null,"work_id":"d1dfc899-7d62-4666-b8f3-a2d1092f0626","year":2013},"citing_paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T22:01:21.826493Z"},"links":{"citing_paper":"/paper/2604.21464"},"observation_digest":"sha256:4d378f37f7af2eb324ea6567e6339d4f6743001da46ee85d76a07d5e5038307a","observation_id":"35bab022-206f-4287-a4c0-27bb397e690f","resolution":{"observed_at":"2026-05-23T15:15:41.128458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.21464","last_updated":"2026-04-23T09:18:25Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T09:18:25Z","title":"Dynamical Priors as a Training Objective in Reinforcement Learning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":3,"verified_fuzzy":18},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2604.21464."}