{"as_of":"2026-08-24T04:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7c54fc46e86004d2270072ce143d11377cfbb150a93f238b49a552afb4cfae8","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:31:38.795970Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.21314/citation-record","integrity":"/paper/2508.21314/integrity","json":"/paper/2508.21314/citation-record.json","paper":"/paper/2508.21314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.883025Z","title":"Optimal control of Markov processes with incomplete state information I,","venue":null,"work_id":"e32cc4ea-a109-4dfb-ad00-ebefb892d3a5","year":1965},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:34.726619Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:23dcb8fc121666c680eb9644968042ee5cdb021a8c4991fa271dd1c82352d751","observation_id":"33b9f85e-83ba-409e-91d2-23c77c4164d8","resolution":{"observed_at":"2026-08-05T14:31:47.937314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.773342Z","title":"The optimal control of partially observable Markov processes over a finite horizon,","venue":null,"work_id":"1be5bc57-002a-4588-aee5-f10e72210afb","year":1973},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:34.806924Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:c324db08aa67ff378e2ba652f111da40588a1a404afdb7aa92fd1b2ac9ec3e81","observation_id":"dbbb163e-c714-4370-a962-f4a5485fde5b","resolution":{"observed_at":"2026-08-05T14:31:47.834699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.639134Z","title":"Approximate information state for approximate planning and reinforcement learning in partially observed systems,","venue":null,"work_id":"fd6b7fd2-eb31-470f-9627-940eff5e1dbd","year":2022},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:34.892758Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:fe25ecbe4434d6a3ebc000d07133deb6a3b2f79a870a3ff36f5ed17d5fd930d8","observation_id":"d77d49cb-4264-422f-b0f9-d3a53976a919","resolution":{"observed_at":"2026-08-05T14:31:47.697682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.464363Z","title":"Deep recurrent Q-learning for partially observable MDPs","venue":null,"work_id":"8a0e98e3-c033-446e-945f-8c7791b81abd","year":2015},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:34.956485Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:ea58ebeb7b149a5853b1112892c77eaa6cc2f32192908f171def3e535894eede","observation_id":"e999cc6a-1015-4d36-921d-d4476f78ce11","resolution":{"observed_at":"2026-08-05T14:31:47.553437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.337321Z","title":"Deep variational reinforcement learning for POMDPs,","venue":null,"work_id":"824376eb-c10d-4e5e-a133-f56c47397ae8","year":2018},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.023211Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:df2fc532a135ca8c9c50ce13638b1c0a5bfc1a6e64783f0b5843caf68cccabfd","observation_id":"159ff1fe-54b4-4789-9574-1d09c12456cc","resolution":{"observed_at":"2026-08-05T14:31:47.378652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.07978","last_updated":"2018-05-24T14:13:20Z","snapshot_observed_at":"2026-08-14T21:04:41.657382Z","submitted_at":"2017-04-26T05:55:07Z","title":"On Improving Deep Reinforcement Learning for POMDPs","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.07978","snapshot_observed_at":"2026-08-05T14:31:35.087409Z","title":"On improving deep reinforcement learning for POMDPs,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.087409Z"},"links":{"cited_paper":"/paper/1704.07978","citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:a2c7589108395b7facbf857e037515902c6276b8d37d80fc494b4d8508a83842","observation_id":"df196e73-64fd-43da-aa25-4a7373d4756a","resolution":{"observed_at":"2026-08-05T14:31:35.087409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.126969Z","title":"Memory-based deep reinforcement learning for POMDPs,","venue":null,"work_id":"af63832f-0e21-4db2-8b5b-421a8061a116","year":2021},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.154351Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:8d185430cd50e65b7b2365857c3120bfe4ced49accbfb6fde2443d0e785b4626","observation_id":"c3d8e18d-0db7-49a9-bafb-4eb16fa66946","resolution":{"observed_at":"2026-08-05T14:31:47.181372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.944808Z","title":"Simple agent, complex envi- ronment: Efficient reinforcement learning with agent states,","venue":null,"work_id":"a9cdf1d6-07f5-411c-a7c0-e175638187c3","year":2022},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.246813Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:301fe065b9b0e0f0dd72542e74d01d888a154fc3d1c41ea5a7dc734df1a3dfbb","observation_id":"4a2642f5-2397-4d12-acc7-5abeb1c96664","resolution":{"observed_at":"2026-08-05T14:31:47.035610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.776402Z","title":"Agent-state based policies in POMDPs: Beyond belief-state MDPs,","venue":null,"work_id":"72364c67-4d57-4be5-be10-4469e23e9f0d","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.313591Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:2122e3db9f6d234859e71a80ca467929ae50bc58de4fdecbd5fed77b69d02869","observation_id":"c9d00860-670b-49b2-8744-f1c80c843f50","resolution":{"observed_at":"2026-08-05T14:31:46.868522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.580670Z","title":"Reinforcement learning algorithm for partially observable Markov decision problems,","venue":null,"work_id":"00097451-49f3-4ff1-ada1-f67020849155","year":1994},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.394078Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:89f0df6b8935aad958c3229e9fb489208fd1a501a0c884c960fbffc7081e2893","observation_id":"c3688d29-c638-4798-aae7-069a54b5d3aa","resolution":{"observed_at":"2026-08-05T14:31:46.655382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.423339Z","title":"Convergence of finite memory Q learning for POMDPs and near optimality of learned policies under filter stability,","venue":null,"work_id":"52a4b7d7-bf78-4ff8-89d0-0bfb82380013","year":2022},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.465534Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:dd399462a734b0c33cfb3f9d842decf990614765cb47538e0a5bc02a3279ba5e","observation_id":"b638296f-62e1-47f6-945b-fb580ccef064","resolution":{"observed_at":"2026-08-05T14:31:46.505820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.181912Z","title":"Periodic agent-state based Q- learning for POMDPs,","venue":null,"work_id":"154d5637-ecbd-460c-b436-459effdc7e82","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.530699Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:cc1335fbff08749fc4e70eaef39099dbe7a923d7d03b8a75d47d51ce90e2d028","observation_id":"5f1c3ac5-5f2b-4344-9903-cbf5a49b5271","resolution":{"observed_at":"2026-08-05T14:31:46.315477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.012802Z","title":"Q-learning for stochastic control under general information structures and non-markovian environments,","venue":null,"work_id":"53825a15-8d78-4e94-8531-454c4d3870c8","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.595069Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:6f7a9a0be2609ae9959fe070c1326874cac69dc1203b6e108c6a50f4c3c0b109","observation_id":"ede0e294-ec60-42b2-8ef0-664e944b95b9","resolution":{"observed_at":"2026-08-05T14:31:46.092609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:45.829090Z","title":"Reinforcement learning in non-Markovian environments,","venue":null,"work_id":"8df08afe-46a8-41f3-bcd3-c9179a54f390","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.677050Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:a66ffdfb9eecb8820c7b1eb372883abe429271e04b1e53b0b603b955452b7ed5","observation_id":"27d0ba31-a0cc-42fd-92bd-10fb265bd4f2","resolution":{"observed_at":"2026-08-05T14:31:45.943350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:45.606862Z","title":"On actor-critic algorithms,","venue":null,"work_id":"e3bc8387-a83e-454f-a5d2-8284ffed633e","year":2003},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.765001Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:03cc70e2c8428ea84721e1333f254856b48baa3ddd7a40616ade85c94f6afb17","observation_id":"4b90a2be-c0ae-463a-94f0-7b2268e34eb4","resolution":{"observed_at":"2026-08-05T14:31:45.692776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T14:31:35.857345Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.857345Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:1af88f5bebc0bd167e985705a3e7ece7015a5ae3996d5d88d73bcaeac87a2741","observation_id":"54d6498f-8d3a-4649-9795-36c8460fc974","resolution":{"observed_at":"2026-08-05T14:31:35.857345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:45.439222Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"265d95ac-0c8d-46fd-920e-135c51581ff2","year":2018},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.945532Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:46d96153e0fd53ae90a838d1c7a133278cc40883bb6afbca7e7f4f1463fa873b","observation_id":"6f54d08a-858c-4b4a-b90f-52c8076f127f","resolution":{"observed_at":"2026-08-05T14:31:45.541911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:45.239519Z","title":"Under- standing the impact of entropy on policy optimization,","venue":null,"work_id":"8dff8ad5-71b3-4a6e-8675-ebb3a7f20650","year":2019},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.011272Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:7d7a393ddab1300939152f8da3df7cec0b35984ca412362f41a10fc2f4997b85","observation_id":"a5c8d233-b142-4b9c-868f-66b4c9e65581","resolution":{"observed_at":"2026-08-05T14:31:45.364516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:45.064138Z","title":"Deep reinforcement learning that matters,","venue":null,"work_id":"2122f4cf-d786-4013-bafe-ba0f259f17ab","year":2018},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.109162Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:3d386817b1fce5fc72a920a392e77724f2e4f5dd2b2653a1f57e7ca9a79c7a87","observation_id":"df1c5df4-e07a-464b-9283-9e5d00a0a50c","resolution":{"observed_at":"2026-08-05T14:31:45.141508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:44.916793Z","title":"Relative entropy policy search,","venue":null,"work_id":"927a76c8-7b12-409f-bf6d-9336b8b30ec2","year":2010},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.204865Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:fe93d862fd042e7bebb178ab12801769be5bd823832863b25698f71785f83924","observation_id":"80329930-38b3-4885-89ff-c0b9b9139e3f","resolution":{"observed_at":"2026-08-05T14:31:44.996455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:44.706215Z","title":"Trust region policy optimization,","venue":null,"work_id":"7fd9db3e-40f3-47c5-bc82-35ecc82ae4cf","year":2015},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.289776Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:55e2605fa6e05a4212af034ae952ff1c56eab5b71a05fb666a52facf11edf889","observation_id":"2b2236a6-2014-46c0-9a35-d4773476fc40","resolution":{"observed_at":"2026-08-05T14:31:44.767473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:44.477280Z","title":"A unified view of entropy- regularized Markov decision processes,","venue":null,"work_id":"cbd09678-406b-4494-ad0d-54b13cec3308","year":2017},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.379160Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:5be0ca02fb6725842ab136ccb977f4f2b14ca168c0675e1c473454e94f7d09b8","observation_id":"d4ace202-8d60-4877-9cce-60afb331329e","resolution":{"observed_at":"2026-08-05T14:31:44.583680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:44.261977Z","title":"A theory of regularized Markov decision processes,","venue":null,"work_id":"91ad3364-6871-4166-8c21-14853ae60fb9","year":2019},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.429516Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:95d40885cb41e725eedd58cc3a6a41b636b966cfcd7e83acff49b16c37cfbc08","observation_id":"f8f17d5c-6661-4d4c-83be-9bea98b722b4","resolution":{"observed_at":"2026-08-05T14:31:44.369959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:44.013544Z","title":"Learning latent dynamics for planning from pixels,","venue":null,"work_id":"fbdbf996-36e6-474d-ac35-631ef263d3cf","year":2019},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.495999Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:78848d0f4ad60ef6dedca805f4420bd862c2a9685f41961ff8ef734f66a4367b","observation_id":"e46cf0c7-e872-4fe8-a4e1-1c1fa766e711","resolution":{"observed_at":"2026-08-05T14:31:44.123291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:43.819586Z","title":"Solar: Deep structured representations for model-based reinforcement learning,","venue":null,"work_id":"32135bcd-d456-40b4-bb65-e8106ada7174","year":2019},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.562816Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:6102d2ed30107c3648c327c455172b7e66288cbd321162103c9eb88e08ec0bc2","observation_id":"21b2282f-babd-462a-9f4d-ed48a9b90bc4","resolution":{"observed_at":"2026-08-05T14:31:43.900185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:43.590289Z","title":"Dream to control: Learning behaviors by latent imagination,","venue":null,"work_id":"a6b0b382-9dac-4ea9-b8f8-abe859d785d9","year":2020},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.626433Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:1d089e9bf3a89451a429a27e4ec9fbd8f3dabf158ed051a7b39971c44666c21f","observation_id":"f8683189-dbd0-49f4-8ad1-d2f855b17ca7","resolution":{"observed_at":"2026-08-05T14:31:43.687181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:43.414643Z","title":"Bridging state and history representations: Understanding self-predictive RL,","venue":null,"work_id":"ad291103-39a9-444e-aaa3-d3762d38ab5f","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.695055Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:0c298b790f1f6478830b50fe9bcb2036ee78b54c9c7b07adef3135ce3bacd655","observation_id":"544e148c-7e2a-44be-afec-00c55961a26b","resolution":{"observed_at":"2026-08-05T14:31:43.482457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09388","last_updated":"2024-02-14T18:37:47Z","snapshot_observed_at":"2026-08-16T14:18:32.478303Z","submitted_at":"2024-02-14T18:37:47Z","title":"Entropy-regularized Point-based Value Iteration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09388","snapshot_observed_at":"2026-08-05T14:31:36.781916Z","title":"Entropy-regularized point-based value iteration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.781916Z"},"links":{"cited_paper":"/paper/2402.09388","citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:9a0322e9c96e8d58ae4b545db70ff61f69a59c5f12f46744662544bc9f39e449","observation_id":"e597574b-5bf1-44e1-9e16-55694b7ce7b8","resolution":{"observed_at":"2026-08-05T14:31:36.781916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:43.194058Z","title":"DESPOT: Online POMDP planning with regularization,","venue":null,"work_id":"42dc7cba-2e5a-43bd-8ac3-b514fb97f690","year":2013},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.867927Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:77d6a86352215cce1257e5750057d9b8c1ae6e9250c29fc524efacf33e24d484","observation_id":"b2bf9b10-891e-4cd9-bba0-2bff1acb2561","resolution":{"observed_at":"2026-08-05T14:31:43.322394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:43.000843Z","title":"Smoother entropy for active state trajectory estimation and obfuscation in POMDPs,","venue":null,"work_id":"5bccaebb-3318-4cc4-8526-295bb8d4e234","year":2023},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.936524Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:1e8de8fd9b5b1dd108809c8ea4db42c02f49de85d020f6a0238d117e97f9b8b9","observation_id":"e19dd16f-0ff1-430d-a5d8-04bc53bb48a3","resolution":{"observed_at":"2026-08-05T14:31:43.069938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:42.850369Z","title":"The limits of pure exploration in POMDPs: When the observation entropy is enough,","venue":null,"work_id":"46ea45c6-c222-4251-8ab5-2772a0b228e8","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.017812Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:b864d33326e58a90090fbc4fb8721f6b60d3fc244fb58b7b058f70fbdcec43fd","observation_id":"a4468ba5-39a4-49b0-9778-870181cf0d07","resolution":{"observed_at":"2026-08-05T14:31:42.908793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:37.084415Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.084415Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:d291245665512127929076b97e956bb4c5d38e19ae5b563937c2868d20ede176","observation_id":"c184507a-1e85-4b33-8a98-74a804bb044f","resolution":{"observed_at":"2026-08-05T14:31:37.084415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:42.592530Z","title":"Hiriart-Urruty and C","venue":null,"work_id":"cdb41b5e-f4ea-4166-85dc-07561cb45aae","year":2004},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.159941Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:444267bb57b585a3495b633c0593738c75f93d2dd0ec0bb81fd2a21af5f7ad8e","observation_id":"18d25e0a-98c9-422f-947b-135b42902d99","resolution":{"observed_at":"2026-08-05T14:31:42.707089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:42.411481Z","title":"Differentiable dynamic programming for structured prediction and attention,","venue":null,"work_id":"a662fe79-d09a-4185-9799-2d3cf76c745a","year":2018},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.237763Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:f97d0f585fec5c1a7da2b0344a3a2a0b0b91d59cec276882ab64b63aa7bffcf0","observation_id":"a55d2cd3-1b4c-4363-89e4-79d9a2276489","resolution":{"observed_at":"2026-08-05T14:31:42.503351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:42.236937Z","title":"Sequential decomposition of sequential dynamic teams: applications to real-time communication and networked control sys- tems,","venue":null,"work_id":"31ae69cb-4a2b-4514-a6e5-c8c2d19e143c","year":2008},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.323069Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:cbd1bcaf0e7e0e6b4e89ecc67acace80a1de571d1e753814a712ce321c984621","observation_id":"7cfe5ea7-ef0b-483e-b378-ccb4976e26bd","resolution":{"observed_at":"2026-08-05T14:31:42.331616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:41.984739Z","title":"Reinforcement learning with deep energy-based policies,","venue":null,"work_id":"7f725e67-3e3d-4438-bb4e-aa3ff67cb1aa","year":2017},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.412286Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:d9245eac3e8a4a7e331458551b664309e54091f9d34ea4b98f64273903e7769a","observation_id":"4de4b806-c3dd-4c6d-9232-57f89e0772f5","resolution":{"observed_at":"2026-08-05T14:31:42.068652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:41.827457Z","title":"A stochastic approximation method,","venue":null,"work_id":"0b76ce95-aed7-4249-aeb7-fc95f23f6970","year":1951},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.525757Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:8679a6068d96c2bba37597d69c6d6970536d5a6878fe04e50198724a65bc430d","observation_id":"040ab679-c9b4-4c4e-a0d3-edf9b0ad9552","resolution":{"observed_at":"2026-08-05T14:31:41.902865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:41.598427Z","title":"Q-learning,","venue":null,"work_id":"b44c6525-dd3f-4534-9c7c-c4b9d98e6983","year":1992},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.615856Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:b80872b50f4bcbb50006906beeb9582713365999c99ae4091868829b07117ee7","observation_id":"3ab540f2-df98-4d98-92f6-2610b567d596","resolution":{"observed_at":"2026-08-05T14:31:41.716577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:41.339813Z","title":"Asynchronous stochastic approximation and Q- learning,","venue":null,"work_id":"698bdae9-85d7-49a9-b7d9-1b32ab7c741b","year":1994},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.652967Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:372cb4ecf319c9c1c57b694dc53276868b87ac84d8fc49544548a9236f14d98d","observation_id":"119f1e27-9cfe-4cb5-b36f-b3e55cf620c2","resolution":{"observed_at":"2026-08-05T14:31:41.485248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:41.076981Z","title":"Learning without state- estimation in partially observable Markovian decision processes,","venue":null,"work_id":"d87309f7-3093-4ecb-a3d1-8ddf0b993429","year":1994},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.681926Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:c2f0f6465051858a51a91b7ca6247d2d2178a4d40e29014307cb9864dbff4ec5","observation_id":"59d2640a-5d45-44aa-b9ff-1e4605571daf","resolution":{"observed_at":"2026-08-05T14:31:41.237200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:40.739713Z","title":"Gradient-based algorithms for zeroth- order optimization,","venue":null,"work_id":"d152e9ac-3c46-46ce-958f-0076d81f6cd0","year":2025},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.802366Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:2211cb21dd54ed8830be27ce51368f4b6ee66fcdf36d7c7808e7d89a4bb87ddb","observation_id":"f091b0cf-ee18-4f4a-bb48-fc5ff88244e9","resolution":{"observed_at":"2026-08-05T14:31:40.858054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:40.545691Z","title":"X a∈A πt(a | Zt+1)Qt(Zt+1, a) − Ω(πt(· |Zt+1))− X a∈A π⋆(a | Zt+1)Qµ(Zt+1, a) + Ω(π⋆(· |Zt+1)) # (a) ≤ γ","venue":null,"work_id":"d93e36ee-3004-4202-9bf5-33f076af20fe","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.911109Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:8543409d0b008d2d8a1ac30323d9d233050aeedc3b92b6b358850addc7ff51a0","observation_id":"df21a8b9-1592-4b0e-a279-2b28286661cd","resolution":{"observed_at":"2026-08-05T14:31:40.652015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:40.266413Z","title":null,"venue":null,"work_id":"179e52b4-e767-4fc5-8e97-3a015a1f98c0","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:38.053757Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:1ff6fe921f2d5c54dc036ea0b2cc2c054f1c4a4630cadab13e785953fc4e31be","observation_id":"8d962d91-cbdd-4605-aec2-ea7843db0b2c","resolution":{"observed_at":"2026-08-05T14:31:40.410414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:39.871262Z","title":"future states","venue":null,"work_id":"72d20570-901d-47a3-8d73-fab3f31714f6","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:38.266308Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:1566d215874e6cb5f8fe552b33d110e73948da14671bec482d6b8954c8d13923","observation_id":"861e7c8a-51fa-45db-8e7c-2d55f55dcccb","resolution":{"observed_at":"2026-08-05T14:31:40.070206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:39.559899Z","title":"X a∈A πℓ t (a | Zt+1)QJℓ+1K t (Zt+1, a) − Ω(πℓ t (· |Zt+1))− X a∈A πℓ,⋆(a | Zt+1)QJℓ+1K µ (Zt+1, a) + Ω(πℓ,⋆(· |Zt+1)) # (a) ≤ γ","venue":null,"work_id":"72c0de8f-1cac-4d91-a6a1-127017ebf6ff","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:38.420084Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:7379f53cd5593eafd4891a7c23de594ce8bde206a3a7517f79ae466877621fed","observation_id":"c5a98ed7-d2b8-4cf5-b4cb-df55b3d781f7","resolution":{"observed_at":"2026-08-05T14:31:39.710166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:39.297949Z","title":null,"venue":null,"work_id":"64075aec-29bb-451c-8cf2-185a4a9cba1c","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:38.616959Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:d90c96999209e53af59db1824282c845f04f16ddf7a64041623abb159b675bd9","observation_id":"8f606a3a-2faf-468d-add3-72e98cb0c788","resolution":{"observed_at":"2026-08-05T14:31:39.414915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:38.977038Z","title":"These two cases must be considered separately","venue":null,"work_id":"3ac10830-a616-439b-bdb4-fed82d9d27ce","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:38.795970Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:0dd19d331c923301b3460b8969d0bc0795c8ac593ecb84315a04e4898437191a","observation_id":"f9b99d8f-132e-4671-ad10-b449dc842323","resolution":{"observed_at":"2026-08-05T14:31:39.077876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-21T21:52:26.689719Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2508.21314."}