{"as_of":"2026-08-16T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e6bbe83d274c10bed1f53fd414137ad734ef1ade53ed61701d6c11ad063ac06","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:42:59.250552Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:42:59.250552Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T15:42:59.404858Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"cited_work":{"arxiv_id":"2411.14019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14019","snapshot_observed_at":"2026-08-12T15:42:59.404858Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","venue":"cs.LG","work_id":"9944123c-3a73-4ecf-890c-1448550831be","year":2024},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.250552Z"},"links":{"cited_paper":"/paper/2411.14019","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:fe08e9ea2c0fcf50ec00644d01f28d6dff0472ce99901369fbcc148c6afb8abe","observation_id":"96c5fc6b-ea2c-407a-b573-4d9f66b394f2","resolution":{"observed_at":"2026-08-12T15:42:59.410682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14019/citation-record","integrity":"/paper/2411.14019/integrity","json":"/paper/2411.14019/citation-record.json","paper":"/paper/2411.14019"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.123943Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.123943Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:9c56a1c294e7a85aeff1085670bb32a81267a62ec2ce359ad3331ebb7b424328","observation_id":"b5c84053-f80e-4b8f-84c1-453c19f3cc2e","resolution":{"observed_at":"2026-08-12T15:42:59.123943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.741460Z","title":null,"venue":null,"work_id":"a795e96e-b8ef-4e96-a7ba-7dc87e231355","year":1997},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.128254Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:6ec871339852e097132436a701d30acacf11cf292e9ab1576003cfc2542c258a","observation_id":"ecdca55a-7bb2-4742-aaef-1a34505bbcd0","resolution":{"observed_at":"2026-08-12T15:42:59.744959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-12T15:42:59.132112Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.132112Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:518929a55460fa09431dd1c397bd6cb629286f04dcbf7e967be84196595a3988","observation_id":"381d1499-5fe6-4378-a685-f75d8aa4fea9","resolution":{"observed_at":"2026-08-12T15:42:59.132112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-12T15:42:59.136421Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.136421Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:4223bf7cad00140ece3c29e744fe33516e58bb58b6c531e949e70086eeae5e4a","observation_id":"24cd254b-6099-4857-9682-86463961ca40","resolution":{"observed_at":"2026-08-12T15:42:59.136421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.731088Z","title":null,"venue":null,"work_id":"46f71f48-56f7-49f1-8442-1e90d7bd2a88","year":1992},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.140358Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:e967a7683a9395f07bcd8cd5d31ad32733e6ea552712b447216ae2c94cf28861","observation_id":"24576388-8192-482d-9d48-c44095a59020","resolution":{"observed_at":"2026-08-12T15:42:59.734943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.721261Z","title":"& V an Roy, B","venue":null,"work_id":"3a0e0489-8fa8-4ac8-b5d0-047642ab7f83","year":1996},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.144006Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:1eaf01da42c1345f6857b48bf23f8d3826e780b9bb5bb4779e979bc04d921b88","observation_id":"fb9eaa60-77f6-4d12-9569-17dc64c5a582","resolution":{"observed_at":"2026-08-12T15:42:59.724610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.711052Z","title":"& Williams, R","venue":null,"work_id":"952c1a72-fdb8-42c1-8771-ec3b4c323b56","year":1993},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.147694Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:657d25f9926a6113575c8ca0084fe10ec288a90920dabe0d2beca593fc71b6c6","observation_id":"99d7a4e1-9531-47c0-9a6c-36dc7f0e74f7","resolution":{"observed_at":"2026-08-12T15:42:59.714635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.151129Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.151129Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:13faba56256f91a394078148e262c5fdb6a1e2695f7b3843be23ca1bfd1710dd","observation_id":"83f9c814-d6f3-4b7a-a427-2955f06f1e62","resolution":{"observed_at":"2026-08-12T15:42:59.151129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.693822Z","title":"& Sutton, R","venue":null,"work_id":"58cd6e78-517b-474c-b4ea-02a4e92e0f72","year":2018},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.154534Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:7453bb267cfcd11785b1d0b774853be9f5d5f3372981d871751fe111a8e93942","observation_id":"6aca79d4-1d02-4420-aef9-2238ca940b1d","resolution":{"observed_at":"2026-08-12T15:42:59.697294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.683949Z","title":"Algorithms for reinforcement learning (Springer nature, 2022)","venue":null,"work_id":"09a79892-88c8-4560-afe3-5c82e69011d2","year":2022},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.157947Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:ed20cbaed48b4dd0e4f0e09684bd799cea6d311ab3df160fb5d61d2a7b94fdaa","observation_id":"f87e1e2e-1a36-4a68-acc0-825f438294a9","resolution":{"observed_at":"2026-08-12T15:42:59.687679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.673282Z","title":null,"venue":null,"work_id":"99c87e22-5050-41f6-b405-d90c71400402","year":2018},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.161517Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:b099ad90bffe86cf75282513570f4c0584820424e572a1000b2a59cff9268cce","observation_id":"7a9d7340-920e-4246-9be3-e5a2dc69fb58","resolution":{"observed_at":"2026-08-12T15:42:59.676781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.663204Z","title":null,"venue":null,"work_id":"30c261fb-8bb8-4014-8f84-277d8d2f5935","year":2000},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.164937Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:fa27ff9ffa4ba8af347cda8d7f87c69bb891f553a07f838b416d1fd54a362685","observation_id":"32a26af1-7437-4fd2-8094-5ba61c633612","resolution":{"observed_at":"2026-08-12T15:42:59.666649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.653379Z","title":null,"venue":null,"work_id":"088414a8-eb67-4cdf-87bc-8f0ff705a8d0","year":1984},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.168279Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:9ab7782ef50c47c7a7a10948849f21a15bc11d4c69ce06021bf8a1a842256b0a","observation_id":"9e936308-dedb-45db-bfe0-127856906239","resolution":{"observed_at":"2026-08-12T15:42:59.657054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.643224Z","title":"& Silver, D","venue":null,"work_id":"02c6d31e-6742-43d7-b150-632cbb215e32","year":2016},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.175545Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:b63d4ac4bf79f1893873142084978361f0ae70e8654a65fe5a42e7bdc4b14299","observation_id":"cec608e5-bf70-4f60-aa52-e78108fc2ecd","resolution":{"observed_at":"2026-08-12T15:42:59.646626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.632858Z","title":"Error bounds for approximate policy iteration","venue":null,"work_id":"73760fcf-104a-4ad9-a7f4-86f631f97454","year":2003},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.178859Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:308642391e16084e21a5f02e3d4318258777fd65c709a3632b769c3e6d7840fe","observation_id":"b2894724-a0e9-4ba2-9528-9381dd00129d","resolution":{"observed_at":"2026-08-12T15:42:59.636542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-15T17:33:32.559096Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-12T15:42:59.182279Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.182279Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:ff14cd365628dcad9a6bec55797780c30a2a7a161a873b8ffda8b4c068b16550","observation_id":"5391d55f-7134-4852-851d-8a29e11141e1","resolution":{"observed_at":"2026-08-12T15:42:59.182279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.622285Z","title":"& Pilarski, P","venue":null,"work_id":"063dc017-4518-4218-a649-284d9e639a69","year":2018},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.185862Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:4e6526c9ae641651d97402dcee53f64ed61fc2332e33367a4776be32ab012403","observation_id":"76a94055-7c46-4536-8752-8daad7f98cb2","resolution":{"observed_at":"2026-08-12T15:42:59.625890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.611708Z","title":"& Wen, Z","venue":null,"work_id":"ca1880fa-cffa-4bb4-a399-936eb8ad6d16","year":2016},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.189256Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:f7a03e2487c3ea86eb69cb779080dafb72d05ece3912a7fd40580bbabd4e5946","observation_id":"9b2e9293-a66c-4e0a-a9e8-bf86c7793da1","resolution":{"observed_at":"2026-08-12T15:42:59.615362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02011","last_updated":"2016-01-20T10:33:00Z","snapshot_observed_at":"2026-08-14T22:19:44.449737Z","submitted_at":"2015-12-07T12:25:18Z","title":"How to Discount Deep Reinforcement Learning: Towards New Dynamic Strategies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.02011","snapshot_observed_at":"2026-08-12T15:42:59.192879Z","title":"& Ernst, D","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.192879Z"},"links":{"cited_paper":"/paper/1512.02011","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:89cc8db7ab310cf4d427fb6a5bd1eb9f1e0e37500c7d22a578b23867fc5bd5b3","observation_id":"4e491de7-3065-4406-9cef-a33d81355653","resolution":{"observed_at":"2026-08-12T15:42:59.192879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.600705Z","title":null,"venue":null,"work_id":"2c860e18-1637-436a-9eeb-7596accc931d","year":1999},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.196488Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:12a2d2bfd7f53cc7717423aaa9be5b94cc57b8cd2f6ac6439999badfd5635747","observation_id":"3e042fc0-aab3-41b1-8c54-9faf9ea65bcd","resolution":{"observed_at":"2026-08-12T15:42:59.604663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.589014Z","title":"Optiongan: Learning joint reward-policy options using gen erative adversarial inverse reinforcement learning","venue":null,"work_id":"90584d29-c622-4499-9824-ab9439b69b47","year":2017},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.199768Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:5df4af5612fc22d3d06fab2d0a3c0584182420336126dc0922c0884d6e7e9116","observation_id":"15c7bbf3-4bd7-4f00-991f-56d3cfba2e47","resolution":{"observed_at":"2026-08-12T15:42:59.592919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.576916Z","title":"Discovering hierarchy in reinforcement learnin g with hexq","venue":null,"work_id":"a7c09cb8-014c-4fdd-862d-41e4c65cf10e","year":2002},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.203160Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:ff43d29381443d2c534519d899188c46ee0f5545682b7e6d25334fcf33669eac","observation_id":"25bf3420-43d4-42aa-a0ea-de2cbe694ad5","resolution":{"observed_at":"2026-08-12T15:42:59.580832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.566178Z","title":null,"venue":null,"work_id":"d72d630b-e298-4d34-b28e-05a433870d8a","year":1999},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.206660Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:4581b5b4a1d1df53aac26361aed130935e8b63a6a33a8f12a803c63651860a81","observation_id":"0de67471-4fdf-4303-af8b-bdaa098d74ad","resolution":{"observed_at":"2026-08-12T15:42:59.570128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.555255Z","title":"& Shimkin, N","venue":null,"work_id":"c84085c5-3ccc-4d53-a3ec-0ce5bd5fa00c","year":2002},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.209835Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:02e560b116b1cf3337bd65c4d62c37183cd837fb22cb371515bfd55b153cad17","observation_id":"2ee35c95-28e3-4b5c-9f77-d23cdeac66fd","resolution":{"observed_at":"2026-08-12T15:42:59.558865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.543846Z","title":null,"venue":null,"work_id":"0de0100d-f113-4a17-aa8b-e8e9c6649630","year":2003},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.213035Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:e2a0fa4be6d3c7239de152073de86cca5b6fbe80f40cf97a010febad7d0af381","observation_id":"f9f7ba4d-e162-4c3c-94cd-6b9179d2d483","resolution":{"observed_at":"2026-08-12T15:42:59.547755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.216225Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.216225Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:8d8949dee233cf4e2de8ee93b1406948994d471cb3143953706a42c2200c9add","observation_id":"08db37ee-5cc7-4356-ac02-a81ee85b08a1","resolution":{"observed_at":"2026-08-12T15:42:59.216225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.526224Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"961cd8b5-18ed-415b-bc89-933f3718bfd1","year":2015},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.219702Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:7f54204439c21e07751c3f27a190583b8850ef7f7eb79e2e07c0cab1df824852","observation_id":"107ff731-acc9-4c2d-a8ee-4c29de087b79","resolution":{"observed_at":"2026-08-12T15:42:59.529899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.223137Z","title":"A markovian decision process","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.223137Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:92830ee38d9ce0be763912121a090d423e429f5dd5733190cd38bb90d8ba2024","observation_id":"4e8acf22-2e3c-486b-a08d-25bec08e83d0","resolution":{"observed_at":"2026-08-12T15:42:59.223137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-12T15:42:59.226498Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.226498Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:d0a53cab3db9074934b6c9a01f4f0bd7b13930cc377c89812d0f0ee6b8568d37","observation_id":"a7040e14-bba6-4992-a7ad-7b1cee181c07","resolution":{"observed_at":"2026-08-12T15:42:59.226498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.509763Z","title":"S., McAllester, D","venue":null,"work_id":"1f100b20-4725-485f-984e-35bf7e1151f8","year":1999},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.229784Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:1deb85afefd6f7130e2f4147cc21074aa70164b581df292ed61a4d153152975f","observation_id":"e20b45e4-f732-4a9c-b065-32c7bdef6a0b","resolution":{"observed_at":"2026-08-12T15:42:59.513143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.499924Z","title":null,"venue":null,"work_id":"8ea39132-8d86-4a31-83f9-66c51d752a17","year":1999},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.232992Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:94132dd29724e653b7ced58f12a754223d4b443e38b528193080dc4fecf8f159","observation_id":"5ebf1381-c522-491a-b65c-3f76c5b8b3e9","resolution":{"observed_at":"2026-08-12T15:42:59.503178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.236178Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.236178Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:914f8a3662452c824ee83319e76e82f85f75ff8edc9ed9ffabddaaa64d48b426","observation_id":"ff5edea6-8a09-4782-aeef-b1888b8d85ab","resolution":{"observed_at":"2026-08-12T15:42:59.236178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T15:42:59.239471Z","title":"& Klimov, O","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.239471Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:7ee730c005e041d8bb55556cbf3c33918624dc63292c23681ce0e16ab62e1ffc","observation_id":"f2de305b-222f-454b-8927-97ea947fc5d7","resolution":{"observed_at":"2026-08-12T15:42:59.239471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:42:59.243122Z","title":"S., Barto, A","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.243122Z"},"links":{"citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:f66dbb36c4baad20c43c055e8726c3e564fb60cd06fefe16422782f7daf0a962","observation_id":"870b958d-5b33-4066-97d1-fdef6dbd1879","resolution":{"observed_at":"2026-08-12T15:42:59.243122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02525","last_updated":"2018-10-05T05:52:49Z","snapshot_observed_at":"2026-08-14T18:19:10.133045Z","submitted_at":"2018-10-05T05:52:49Z","title":"Where Did My Optimum Go?: An Empirical Analysis of Gradient Descent Optimization in Policy Gradient Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02525","snapshot_observed_at":"2026-08-12T15:42:59.246831Z","title":"& Pineau, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.246831Z"},"links":{"cited_paper":"/paper/1810.02525","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:d2c750557b20cc773a3f6d92f11c0d0f2e3748c837fd8d5c62b54eb67f1784a1","observation_id":"e860f8dc-57df-468f-a7eb-c6b993051fe4","resolution":{"observed_at":"2026-08-12T15:42:59.246831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"cited_work":{"arxiv_id":"2411.14019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14019","snapshot_observed_at":"2026-08-12T15:42:59.404858Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","venue":"cs.LG","work_id":"9944123c-3a73-4ecf-890c-1448550831be","year":2024},"citing_paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:42:59.250552Z"},"links":{"cited_paper":"/paper/2411.14019","citing_paper":"/paper/2411.14019"},"observation_digest":"sha256:fe08e9ea2c0fcf50ec00644d01f28d6dff0472ce99901369fbcc148c6afb8abe","observation_id":"96c5fc6b-ea2c-407a-b573-4d9f66b394f2","resolution":{"observed_at":"2026-08-12T15:42:59.410682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14019","last_updated":"2024-11-21T11:03:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T07:03:59.831232Z","submitted_at":"2024-11-21T11:03:07Z","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2411.14019."}