{"as_of":"2026-08-13T02:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72b2b3c395d57dcc897ba70c3769537c1422fde43ab728479328de7fe93938d5","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:01:47.191696Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09523/citation-record","integrity":"/paper/2507.09523/integrity","json":"/paper/2507.09523/citation-record.json","paper":"/paper/2507.09523"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:44.735602Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:44.735602Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:737ac7e5811b8deebb4a414466ff69cefca63daf5c11fed59057c24ab9159495","observation_id":"82aaab77-0338-46e0-bb06-92e787f30d06","resolution":{"observed_at":"2026-08-06T18:01:44.735602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:51.242433Z","title":null,"venue":null,"work_id":"cef9f66c-fa37-4a23-8f93-4af40eea2da9","year":1993},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:44.855222Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:0ccc10d9a19b95b01eaaed227ea20ef9cc251fb1c0f8d568b3355e37452fb433","observation_id":"a2eb5b45-b5dc-4f01-b32a-fa21b259404f","resolution":{"observed_at":"2026-08-06T18:01:51.426569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.999654Z","title":"Sur les op \\'e rations dans les ensembles abstraits et leur application aux \\'e quations int \\'e grales","venue":null,"work_id":"c752fe93-f1a1-4294-bb5f-1da9954f7875","year":1922},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:44.976043Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:b74897e6e8a44b8f8b47a53298e6fd513a264ad3d97449911c46d422a2442d11","observation_id":"49aac7d9-f0e4-4fd7-be52-3ff2dcc6abd5","resolution":{"observed_at":"2026-08-06T18:01:51.113175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:45.055174Z","title":"Dynamic Programming","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.055174Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:969a0c9dd7cafbd0ae7ccf50595a650a6193e6fe8cf8f1b8f2f695ac8bc3d99f","observation_id":"88c31345-0586-4a52-b1f5-a7038a19a76d","resolution":{"observed_at":"2026-08-06T18:01:45.055174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.855275Z","title":"Bertsekas and John N","venue":null,"work_id":"dfe70e5c-8c6a-4e1b-93ed-cc2e513df9fa","year":1996},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.192835Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:def4eb150dac02baf353a89d18764365260eac650e78a733cf091651dabe0d8d","observation_id":"7450fe15-d8bf-428c-9bda-665639b9468a","resolution":{"observed_at":"2026-08-06T18:01:50.904931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.699085Z","title":"Multistep Credit Assignment in Deep Reinforcement Learning","venue":null,"work_id":"518d344f-f52a-4b9e-ac56-68b864826acc","year":2025},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.304714Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:34ecce21801a8f9ce50c9f3a4dde497dc78ef1a774591d1f9ef4f6a1cc9a7003","observation_id":"fbe8b06b-4a0d-4413-a3e5-73037c103b4f","resolution":{"observed_at":"2026-08-06T18:01:50.775974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.554512Z","title":"ChainerRL : A deep reinforcement learning library","venue":null,"work_id":"013f6a2a-3b73-4d8d-95fe-1870a9a93d9d","year":2021},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.368932Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:cbdcdcdb75f4621f00c8560ad9d6524a8d3bed78e00c61e99f9cab52b182f98d","observation_id":"49119f6f-aff3-4fbb-8560-2f69162cbcff","resolution":{"observed_at":"2026-08-06T18:01:50.632827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.426739Z","title":null,"venue":null,"work_id":"0867f647-37e9-4517-9eb1-fe0aac8acbcd","year":1994},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.486551Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:56998bd9406ff874acb45cc618c209a96b88f49f340c3b1939ca199de4b7b2fa","observation_id":"7dfa3418-b4fe-4d31-83b9-87ac0e446569","resolution":{"observed_at":"2026-08-06T18:01:50.491388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.304235Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"5126a846-d884-422c-b146-0501564cb60c","year":2015},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.604642Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:99b630716a74b4207bd941295c83e9b879a90e399edab5bf00d279c8e966ce3f","observation_id":"d742ebfd-07fc-4337-90c9-25fd85e9f059","resolution":{"observed_at":"2026-08-06T18:01:50.360877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.132515Z","title":"Orr, and Klaus-Robert M \\\"u ller","venue":null,"work_id":"39dcc347-3527-431f-9848-c00e4640c060","year":2002},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.697423Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:04169d3c8cae147fb1181fa83fd7a5380456e09a5d01656d864e862de982606f","observation_id":"58a7a71b-afa8-4ac7-82b8-9c0fbb5dfb7a","resolution":{"observed_at":"2026-08-06T18:01:50.213833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.009121Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"528b05e7-786a-4960-8bfb-967613705f15","year":2015},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.818776Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:ba68d95f856f8f9adeca698c09bc51315165666dcfd970d70923c04ca2dba278","observation_id":"9a3e49df-698b-4a37-8b30-74688ca8b8b5","resolution":{"observed_at":"2026-08-06T18:01:50.064504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02215","last_updated":"2023-11-03T20:03:54Z","snapshot_observed_at":"2026-08-10T20:29:44.751726Z","submitted_at":"2023-11-03T20:03:54Z","title":"Towards model-free RL algorithms that scale well with unstructured data","version":1},"cited_work":{"arxiv_id":"2311.02215","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.02215","snapshot_observed_at":"2026-08-06T18:01:47.394239Z","title":"Towards model-free RL algorithms that scale well with unstructured data","venue":"cs.LG","work_id":"2f458956-f2b9-4ab4-90d4-21dfc13654c6","year":2023},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.917099Z"},"links":{"cited_paper":"/paper/2311.02215","citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:9f84e34afae8ab9cc60767a2cf866e1a246ced82150589fc1a1f9fd5fe275b84","observation_id":"c9259be3-76b0-4b10-a6a0-c393a0c51e4d","resolution":{"observed_at":"2026-08-06T18:01:47.519541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.876524Z","title":"Revisiting Rainbow : Promoting more insightful and inclusive deep reinforcement learning research","venue":null,"work_id":"2bf09cbc-5c5e-4780-a83f-4db3b063e65b","year":2021},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.020479Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:c69f0744a073dccb470e4e116be21a08270556a883b8aeee046202c06fff2938","observation_id":"03ae75ac-1be6-466a-bae3-d767da002530","resolution":{"observed_at":"2026-08-06T18:01:49.937782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.781232Z","title":"Rummery and Mahesan Niranjan","venue":null,"work_id":"a95c0f89-b65f-4ab8-9d6d-3c66eea45849","year":1994},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.115279Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:a6d30f3f4843df540e8eab631c61c94fd3d2a2267d02ddd8250e478ea283caa8","observation_id":"b6d1f872-1467-4ef7-83ea-07d58b4a3290","resolution":{"observed_at":"2026-08-06T18:01:49.834689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.645551Z","title":null,"venue":null,"work_id":"0f048e47-0786-4edf-b587-f9c344a2e79b","year":2020},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.207382Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:4dc35ff54654a1d0ff48ba771be4b8bce75552788e98f7e0e64cb3ba76005ff0","observation_id":"49ad9446-5ee9-4e3d-b989-db0a0616c173","resolution":{"observed_at":"2026-08-06T18:01:49.703269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.516559Z","title":"Littman, and Csaba Szepesv \\'a ri","venue":null,"work_id":"c59c6a9f-ebe3-40fb-ba1f-229f0fa7a2af","year":2000},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.290297Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:b6de19d779bf3e2a6932c5d2aa4adafe12aaa6f91aea262cbc92795f12a65f4b","observation_id":"8cff4409-b4e7-4c88-bd2e-fb44c043a8b3","resolution":{"observed_at":"2026-08-06T18:01:49.575152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.369548Z","title":null,"venue":null,"work_id":"2066588b-8b5f-43be-a7db-a86e11419691","year":1988},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.377144Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:02abe4595ef5a7b514af85249dad086ce0c19bebb5b87d5daef42faadd74c94c","observation_id":"58931b2f-9137-4d8e-a2c7-a1c07d8fb3ce","resolution":{"observed_at":"2026-08-06T18:01:49.427621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.227120Z","title":"Sutton and Andrew G","venue":null,"work_id":"1bcfb51e-d0cb-4a38-916b-6b106e48f514","year":2018},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.468196Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:439f6149bd643e07b6bab21111e77f6b768d51bd8302a4209850d2a72c52d08f","observation_id":"90ab8c3d-19a9-4e2f-8f9d-8f470a925902","resolution":{"observed_at":"2026-08-06T18:01:49.289687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.067000Z","title":"VA-learning as a more efficient alternative to Q-learning","venue":null,"work_id":"c604dee0-e807-4cde-8ab4-4069dda9fc69","year":2023},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.563594Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:5073b91f517711626ecfe4bca151d9118c60e8c540dfcea88382af3df174d070","observation_id":"380e6ba9-f74a-4281-accb-a82f3045e7c2","resolution":{"observed_at":"2026-08-06T18:01:49.135279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:48.925659Z","title":"Double Q-learning","venue":null,"work_id":"dede0e73-09f4-4276-a8aa-64133be1452f","year":2010},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.638334Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:6dd5446929095eab9d864d560c595f968d91396faf62f22565484246c7ba67cd","observation_id":"41bad30e-a29f-44fd-993e-b5942ea11e2f","resolution":{"observed_at":"2026-08-06T18:01:48.994867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:48.761942Z","title":"Insights in Reinforcement Learning","venue":null,"work_id":"e07b4aec-0f7e-4ba3-96e9-1bf91c989783","year":2011},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.723290Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:633b5fd5734b2015cee2176cb9ba9a3d11618086ddeeed631ca76d7f15ef5279","observation_id":"2413f22d-5b75-47ec-b6f8-1940c20fd601","resolution":{"observed_at":"2026-08-06T18:01:48.840394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:48.645754Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":"d1ebb7ad-2a9f-4e8c-991a-cd15961d5d4d","year":2016},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.799484Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:82761d3f88f3e7ef1079fc91dcba74a3ba7eb42a7a464b51c40f28e3052777ae","observation_id":"344721d1-d006-4cd5-be36-51e75d1f6521","resolution":{"observed_at":"2026-08-06T18:01:48.710073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:48.494440Z","title":null,"venue":null,"work_id":"59bcf2bc-3fac-48d0-9a67-96559c54558c","year":1989},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.815493Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:84d9129079a11054ee2b7313c2f981212233303f96d6c52087a17602e685a829","observation_id":"3bc160fe-f2bf-477d-8e61-9713e3fe5b9d","resolution":{"observed_at":"2026-08-06T18:01:48.572660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:48.265467Z","title":null,"venue":null,"work_id":"ebc68468-fba0-4e93-abb1-e502f0d281a5","year":2005},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.827140Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:f1518fd2f128b25648f8002b703cd2cda6f68393f444cc0abed8f4752ba5b1e7","observation_id":"15cdb5f2-f4e9-43b5-91fa-fc55735cdd2f","resolution":{"observed_at":"2026-08-06T18:01:48.406295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:47.942361Z","title":"Wiering and Hado van Hasselt","venue":null,"work_id":"ffa6ae51-933e-42ad-a185-72e2d31074d6","year":2007},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.894642Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:8b054aea33d36b5beea32920bed795ad38d78adf846f90b3bfa68fcd22cac000","observation_id":"a390f672-f32c-42d0-aa0d-86a298d88ebc","resolution":{"observed_at":"2026-08-06T18:01:48.101275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:47.655437Z","title":"Wiering and Hado van Hasselt","venue":null,"work_id":"16587cbe-034a-4de0-8352-0f2a9311c888","year":2009},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:47.067674Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:0ac8a0301babcc5ed1cd15146ffc50b6a7f703b99572727db0065d075a0a44c2","observation_id":"d490c7c4-2992-4a36-8d87-4706443e9f22","resolution":{"observed_at":"2026-08-06T18:01:47.826751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-07-06T07:37:51.655095Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-08-06T18:01:47.191696Z","title":"MinAtar : An Atari -inspired testbed for thorough and reproducible reinforcement learning experiments, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:47.191696Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:927597b607ec61bb8578767709bab427037b18d1be3d2256184b1dbee1e2bed3","observation_id":"85b62dba-ea0f-4746-a7cd-3f2f496889b6","resolution":{"observed_at":"2026-08-06T18:01:47.191696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T20:30:00.534834Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2507.09523."}