{"as_of":"2026-08-20T03:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7bd4bd52fffcaaecdc3a064080340c9e84e8069f16891dca15a500719a0c4c45","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:18:54.597741Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.09770/citation-record","integrity":"/paper/2501.09770/integrity","json":"/paper/2501.09770/citation-record.json","paper":"/paper/2501.09770"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.370316Z","title":null,"venue":null,"work_id":"dabf050d-3981-418c-8694-3600a753a45e","year":2019},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.313630Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:b76e2abbd4086e904a48b259d73d70060b3469a811ff4f98cf9c118c645549fe","observation_id":"65d770e9-5bc7-47fc-950b-56219e471179","resolution":{"observed_at":"2026-08-10T20:18:55.374622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.358591Z","title":null,"venue":null,"work_id":"f7906cc8-4d49-4733-b2bb-59737b25616e","year":2001},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.318332Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:f2ab02cc8e02c767d6f28b43ebcd51e347b871264cfe453d4b1554951b70b465","observation_id":"f156f3b7-cbf4-452e-85cb-14ae345013a4","resolution":{"observed_at":"2026-08-10T20:18:55.362675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.346662Z","title":null,"venue":null,"work_id":"1cc19f32-9e23-428b-89f4-8251e30ac071","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.323269Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:63c3e39a7641de0fb5ff150c80cd597093650b222ba8cdfc449aa3d9774c6e4e","observation_id":"a07b9c36-13ff-465e-b071-dc60579f4313","resolution":{"observed_at":"2026-08-10T20:18:55.350423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.334297Z","title":null,"venue":null,"work_id":"1a22fd0a-01a3-4eda-802b-c5e8ecf25f72","year":2024},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.327902Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:0cc41738f1f9852a2da79aa8d46bdf2f330dfc4ea47bc0eb583a6c998adf112f","observation_id":"ca618fa8-2300-4866-a12f-0e3a47d9101c","resolution":{"observed_at":"2026-08-10T20:18:55.338555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.322041Z","title":null,"venue":null,"work_id":"a42fa714-2050-4c49-813b-8043ce9e94e9","year":2019},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.332200Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:f9539b083a11af876a9d241fa2b207cb8ec8f6c40f24ea0a65dc2f7012d66811","observation_id":"88b70520-196a-4406-90ae-1bf19bbd3e44","resolution":{"observed_at":"2026-08-10T20:18:55.325761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.309798Z","title":null,"venue":null,"work_id":"eb2609a9-4ab5-491b-aa4a-e543ff52ea37","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.336320Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:a2c8e5a74476326b39f807146ff73ad7fe1f792d04398baec6761e62abfb6b46","observation_id":"feea5357-a9cb-45b0-9a44-15c7dd0c7274","resolution":{"observed_at":"2026-08-10T20:18:55.314279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.298665Z","title":null,"venue":null,"work_id":"e46c844d-d80f-40d1-8ad3-4c362bde0ab1","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.340860Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:1f84870a29c56682395bf517ad968969d258673f466aeaa9b6f1a615e138d41e","observation_id":"50aa51f8-9cab-416c-b499-c05e5d1893df","resolution":{"observed_at":"2026-08-10T20:18:55.302385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.287035Z","title":null,"venue":null,"work_id":"ca5cfbe6-19e8-4175-89f7-3a0c3ce5f355","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.344791Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:152ccd9cf8ea744803ddf9ae07d3c16d3ce4206a44c5a1e66d09b58ec7e60e11","observation_id":"ebe5708d-812a-4a64-8965-2b3baad95312","resolution":{"observed_at":"2026-08-10T20:18:55.290940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.274901Z","title":null,"venue":null,"work_id":"bd072d33-457b-4610-b899-3a9b474f427c","year":2022},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.348651Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:2b7f0efbac64eacd657fd548ae12c9f57495ea4e81130d3412a5d075a60fe784","observation_id":"879fea58-6bb7-4c52-9269-cde671cbc813","resolution":{"observed_at":"2026-08-10T20:18:55.278607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.352488Z","title":"G.; Naddaf, Y.; Veness, J.; and Bowling, M","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.352488Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:155e236026de9081a3a1cb01291e2e2a9a021fdb57114171a74c054aee11b730","observation_id":"86069253-4b17-4c11-95c1-f1fe5300e620","resolution":{"observed_at":"2026-08-10T20:18:54.352488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.356499Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.356499Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:17ed2a79532f871a9229a7b3f2d56b54659fbc09ae6441e829b81c80482a317c","observation_id":"cd5f2deb-9a95-4181-8301-1e3f6b9c05ee","resolution":{"observed_at":"2026-08-10T20:18:54.356499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.250425Z","title":null,"venue":null,"work_id":"a3919ee2-53eb-4bc6-8667-6981df4c33d9","year":1962},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.360440Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:48fcbc8959591f683b173ced433022db5f3c23346dd9b9e42e030509bbd25915","observation_id":"a889e45e-3dce-479e-ab19-7d967a3ba9c8","resolution":{"observed_at":"2026-08-10T20:18:55.254233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T20:18:54.364241Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.364241Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:225cd46c4d619ba5451735cf776f985cba7193b124f3597d0bcded2781595504","observation_id":"2abebcd0-5ef3-4334-9b86-c337e6e2508f","resolution":{"observed_at":"2026-08-10T20:18:54.364241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.237950Z","title":null,"venue":null,"work_id":"6709fce5-c77a-4276-896c-9362a8b5a581","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.369259Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:59c001816a8f2d86357c9fe8d761d763280c9adf911e1d629c0c1c8fe7441f1b","observation_id":"a63e3685-30ff-4ebc-b2d4-762dc7badbfe","resolution":{"observed_at":"2026-08-10T20:18:55.242743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.224816Z","title":null,"venue":null,"work_id":"3abd8d60-a391-4796-ba17-02a28727bf32","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.372900Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:53774010ec2508c2fe0248ba77ae743984d44c989b4f22541c9cec40315862cb","observation_id":"abcebbd3-62dd-4e1e-95e9-f262da025bdf","resolution":{"observed_at":"2026-08-10T20:18:55.228668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.213419Z","title":null,"venue":null,"work_id":"bafa1764-a74f-4475-90aa-0bd34dedd73c","year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.377257Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:74d13026295c37cff49c1a374e713aa0141ad9a3f5d3e9b19e769121a556d360","observation_id":"a124ca8f-debb-4652-9c48-88a42549a1c6","resolution":{"observed_at":"2026-08-10T20:18:55.217126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.201383Z","title":null,"venue":null,"work_id":"424e6fe5-29db-4ff4-9d7f-b5c916a7c3d9","year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.380476Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:cdc9ce84bf40225cc1df7633a739615e38101af072ecdc833e977024a3ab8215","observation_id":"41d9c10b-6d9f-4f37-baf2-c5fc5406c579","resolution":{"observed_at":"2026-08-10T20:18:55.205954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.08920","last_updated":"2021-08-03T11:20:08Z","snapshot_observed_at":"2026-08-17T14:01:10.156706Z","submitted_at":"2020-10-18T05:06:01Z","title":"Average-reward model-free reinforcement learning: a systematic review and literature mapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.08920","snapshot_observed_at":"2026-08-10T20:18:54.384396Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.384396Z"},"links":{"cited_paper":"/paper/2010.08920","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:a27cd0089f5fa4dbce1128528cbb161402626cb2b5f9535b3556d1fb5111b5b4","observation_id":"61bb5e79-6577-4381-80f8-ff3ef6ca5e0b","resolution":{"observed_at":"2026-08-10T20:18:54.384396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.189852Z","title":"M.; and Mansour, Y","venue":null,"work_id":"980b624c-f030-4c8a-aecf-5a33846d97ef","year":2009},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.389194Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:22334997e90229b308c1128ba1d78038a1e1a9e096d9393e59be8c1e9634c0ca","observation_id":"85c937ff-9500-4fbc-80a9-e13348d6ab5f","resolution":{"observed_at":"2026-08-10T20:18:55.193576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06070","last_updated":"2018-10-09T23:19:52Z","snapshot_observed_at":"2026-08-14T19:45:07.867570Z","submitted_at":"2018-02-16T18:57:57Z","title":"Diversity is All You Need: Learning Skills without a Reward Function","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06070","snapshot_observed_at":"2026-08-10T20:18:54.392632Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.392632Z"},"links":{"cited_paper":"/paper/1802.06070","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:77a913081f3c641f6d80d7bdbc2a230881d5a7daf6979a268b548e398eb24e46","observation_id":"aa675ee4-7f61-4263-9fa7-9ac82e55c090","resolution":{"observed_at":"2026-08-10T20:18:54.392632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.178504Z","title":null,"venue":null,"work_id":"61abd6b0-40a0-4add-b19d-cfd7cc7eb063","year":2022},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.396342Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:6ad3eaf87ef83a198365ad6413b5e54673d1129b95dd971aaebffbed0daea759","observation_id":"8e5d70c6-72d5-4776-9dba-d7ed222a10c9","resolution":{"observed_at":"2026-08-10T20:18:55.182376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.399568Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.399568Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:1932f17fbe0e2e67396034d06479e034e673385039a556cef4f8cfdaf94e1d3b","observation_id":"b94206cf-4d6d-4878-beb2-d51cbe5ed083","resolution":{"observed_at":"2026-08-10T20:18:54.399568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.160428Z","title":null,"venue":null,"work_id":"42f65bc6-b339-45f8-a081-2064ec8d6413","year":2019},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.403177Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:a85cb3eeb045ab1d601a994152cc5ae5d6161c7b17829a238e98a4724e1432ec","observation_id":"87d157fc-3e76-43ff-8c41-830ab3843644","resolution":{"observed_at":"2026-08-10T20:18:55.164191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.148319Z","title":null,"venue":null,"work_id":"f902a218-c6c5-4b45-9f8f-2147c8391aa4","year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.407089Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:82f7ede2d20741b0eab63c81e924e3f32921c0d6538674d820d2de3148571701","observation_id":"4638b31c-b369-44af-877c-139da08982f2","resolution":{"observed_at":"2026-08-10T20:18:55.152729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.410677Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.410677Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:39fe1b4cf19b7f2460e9006102d4d45435a110290f6bd7fadc7938799f758d8d","observation_id":"3be3e702-7077-4048-be0f-1dd71cfe77f9","resolution":{"observed_at":"2026-08-10T20:18:54.410677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.128566Z","title":null,"venue":null,"work_id":"e9cf351f-3524-4849-a709-e0db29da6874","year":2017},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.414485Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:abd8a6f24e7a13f72ab88150d16c6d6038393a1bf31940675b1432fb1abc8abb","observation_id":"7e1f4295-c1cc-4fe7-82d6-e0b1b67eb407","resolution":{"observed_at":"2026-08-10T20:18:55.132490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.116642Z","title":null,"venue":null,"work_id":"01fba834-2026-4c7a-ae40-674dbbf17613","year":2017},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.418061Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:d7372917ad039bde5991db4509f0252ec90ae86812772c923be5fbc330dc23e3","observation_id":"e6ad8b45-0f26-40ed-90d5-aa09116e6781","resolution":{"observed_at":"2026-08-10T20:18:55.121091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.104409Z","title":null,"venue":null,"work_id":"c20eb714-f4fa-4077-92ab-60a759fdfafc","year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.421827Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:081f63bfb5ae44d6c5ea4dfb89964322929c6ebb9d8ed886b2a5d8b7b94a985a","observation_id":"3f215f5b-49a2-4c8d-aec2-2e0d5694df79","resolution":{"observed_at":"2026-08-10T20:18:55.108632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-10T20:18:54.425456Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.425456Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:80e330f06c164729547925d25234e047f363c1de64b3fe0074000bd523789f6c","observation_id":"53921fef-0e5d-4d86-b9f4-831f18812bc0","resolution":{"observed_at":"2026-08-10T20:18:54.425456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-10T20:18:54.429473Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.429473Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:d59343e7fed6f8780d02c9faa703ed2ed8f65cb106c379a90be6756c897deccc","observation_id":"7a007c2f-6858-4cb2-bcf9-bb79a7a3c96a","resolution":{"observed_at":"2026-08-10T20:18:54.429473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.092984Z","title":null,"venue":null,"work_id":"99bf5de3-64f8-41ef-97e2-78594c84a012","year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.433593Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:55f59c10e673ec81430d876832f0deef37889bad2f721168d26e0d8087c6e026","observation_id":"7952512f-7e42-40b4-96d5-bf6f49fe4b9d","resolution":{"observed_at":"2026-08-10T20:18:55.096820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.438405Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.438405Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:70e71d2a136bbfaba3819722ce36071b218f9d1122453553736681bb8bdc3390","observation_id":"db433991-9ac4-4e10-8020-8942c2e48303","resolution":{"observed_at":"2026-08-10T20:18:54.438405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.074378Z","title":null,"venue":null,"work_id":"bd699ded-c836-4239-a25c-6f01bf66f2a4","year":2003},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.441755Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:de212d28284b39e30c3abaccaf83cad591ff2fa5c4929d139e93f5506b58611f","observation_id":"4af9e5de-ad97-43b5-87ae-eaed28f65d8e","resolution":{"observed_at":"2026-08-10T20:18:55.078196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.062194Z","title":null,"venue":null,"work_id":"7e72e658-dcb9-4b6d-8d46-85e2d8d43ad0","year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.445012Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:02f716928c0f42eec253ccbee1cbc16cd6f38539f1d5f2ee60c9dbd3edc05599","observation_id":"b23ec61d-2372-4b91-8ac8-b45e9727cea7","resolution":{"observed_at":"2026-08-10T20:18:55.066601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.049894Z","title":null,"venue":null,"work_id":"2dcc4970-1dec-45e7-a12a-7b77389f3c5c","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.448681Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:d1662feace0668707e06609815c61fd8aa8f94592a45875378f6490cabc592ed","observation_id":"58b1a80b-5124-4167-9622-7ee9eeb8e321","resolution":{"observed_at":"2026-08-10T20:18:55.053650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-10T20:18:54.453908Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.453908Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:ff3bde81dddfa13684dcc28a584eaa1cb8c8638c79c3bed5746cee3ef3ef2a67","observation_id":"7a730476-9bc0-4164-a40b-117398ffa75c","resolution":{"observed_at":"2026-08-10T20:18:54.453908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.037750Z","title":null,"venue":null,"work_id":"65540c22-d106-4397-9711-38e1dc5d214f","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.458168Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:ac81d9f0f31deee4e63a865a8188db2ce8ce2499a7a8335f5f3500e67fdebdb0","observation_id":"cb525d66-3249-406b-89e6-7c5e3ef22a28","resolution":{"observed_at":"2026-08-10T20:18:55.041856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.025250Z","title":null,"venue":null,"work_id":"fee60c88-a1be-4ac0-9552-1e4558764d13","year":1996},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.461642Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:11c28ba2cc5f7e865c140fcd1a316c54fa773a57c99c6f64b6b526cf3e025ce7","observation_id":"c3703139-9a53-42a5-84a5-b540007b3efa","resolution":{"observed_at":"2026-08-10T20:18:55.029182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.013525Z","title":null,"venue":null,"work_id":"4fbfcbd8-b16e-4a83-a9fe-d936a0b1ca2e","year":2012},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.465764Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:001b14ab7cda222ad4ab284b0ad828520aff2f30f9c85f5637bf9bdac5469b1a","observation_id":"75e994bd-14fd-4c55-85bb-be63010d9555","resolution":{"observed_at":"2026-08-10T20:18:55.017598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:55.001233Z","title":"K.; and Newton, N","venue":null,"work_id":"823bb0d9-dfe6-4b49-94c4-49c5e5aa27e1","year":2000},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.470418Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:eb55b9eabb50b58b7887c533d0b15a40efcc9cc7b093457f1fcbd7e27342c79c","observation_id":"1869761b-2929-4f8a-abfb-2d7c12233edc","resolution":{"observed_at":"2026-08-10T20:18:55.005357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.473687Z","title":"A.; Veness, J.; Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.473687Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:13e1c04ce9e3a1170238fb9f9698869353e0d6853936e210302220ebb3918487","observation_id":"5742ce71-65a8-4641-83cd-1fb69ecb2f4f","resolution":{"observed_at":"2026-08-10T20:18:54.473687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02140","last_updated":"2019-11-27T07:28:55Z","snapshot_observed_at":"2026-08-19T13:37:21.288323Z","submitted_at":"2019-10-04T20:52:39Z","title":"Discounted Reinforcement Learning Is Not an Optimization Problem","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02140","snapshot_observed_at":"2026-08-10T20:18:54.476829Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.476829Z"},"links":{"cited_paper":"/paper/1910.02140","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:75e2eb63e34268679056ad51a47f0c47de6aa46d3bf96ee83e43c299537c2986","observation_id":"22b76259-2cec-4a0e-bbd6-fe5c3402b724","resolution":{"observed_at":"2026-08-10T20:18:54.476829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09999","last_updated":"2024-10-30T14:18:42Z","snapshot_observed_at":"2026-08-17T16:56:48.053689Z","submitted_at":"2024-05-16T11:33:49Z","title":"Reward Centering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09999","snapshot_observed_at":"2026-08-10T20:18:54.482883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.482883Z"},"links":{"cited_paper":"/paper/2405.09999","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:3f2fb8b7cb8d4972ec28a89a2a233560f13ab22c29cc62429af6bcbacff1d368","observation_id":"9bf000a4-bd3c-420e-ba75-056e82a177dd","resolution":{"observed_at":"2026-08-10T20:18:54.482883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-08-14T20:59:03.934741Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-10T20:18:54.487766Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.487766Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:6dc213d6dcb31882aea2fa50b1ab31e7cb67413fe5da6fae4aae9b4e96321000","observation_id":"111e04c3-a567-40db-b16e-d57933c0b389","resolution":{"observed_at":"2026-08-10T20:18:54.487766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.981649Z","title":null,"venue":null,"work_id":"95696cf6-c72d-400e-b8a6-d8601c7daeb8","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.492473Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:0ffbddb162e867a6bdd7a254a530467821517fe404859a4c09de4393542dfb67","observation_id":"5ccac08d-ad7c-4eab-bed1-8ef71ac96a5f","resolution":{"observed_at":"2026-08-10T20:18:54.985492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.496400Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.496400Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:b47649e9b20fd4e8fdefc81faea1cc5ace37a10e0fccc58739d639e92ce5ef73","observation_id":"a870d33b-c17a-4ed0-b668-edcfa3c1bef6","resolution":{"observed_at":"2026-08-10T20:18:54.496400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.963026Z","title":null,"venue":null,"work_id":"3023cc20-321b-4e6c-8af6-3743f9a47762","year":2012},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.500783Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:265bdf11d77e6110f5035005a034cd18268fa6d0c7fed8d5fb0c152cc3bf67bc","observation_id":"87c3423a-461c-452e-b9fe-40aaf4ba58f5","resolution":{"observed_at":"2026-08-10T20:18:54.966692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.951577Z","title":null,"venue":null,"work_id":"6f11a48d-3847-4d20-a600-4fe4457c371c","year":2013},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.504210Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:b48964d768a2b4f0693264076d3014efa8284078ff09bde3dac0dc1b4e016503","observation_id":"c0b1466c-e5da-4b5e-a3f3-b687ac8d5c94","resolution":{"observed_at":"2026-08-10T20:18:54.955565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.939349Z","title":"C.; Mair, J","venue":null,"work_id":"007c097c-8fba-42a5-9da2-982e135cd7bc","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.508063Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:39c1021ad2df924360a0da8d76c4870976574bad3a7ce5a74f06b828e33e8a88","observation_id":"949c2678-3f98-4d5a-a508-59f02b562ec4","resolution":{"observed_at":"2026-08-10T20:18:54.943786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.926823Z","title":null,"venue":null,"work_id":"73a5cb7f-d536-4680-a424-989658a9f30b","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.512479Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:2f39e3bdd74f7a3c8b81bde5f8c28a162a70ea1cddce95124bc51ef6c0065ecb","observation_id":"4499b207-21a6-459b-92bf-07e0d3de518c","resolution":{"observed_at":"2026-08-10T20:18:54.930886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.914607Z","title":null,"venue":null,"work_id":"87bdd9bc-bb09-471b-9bce-69b9954f35ed","year":2023},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.516923Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:25e617b8787d027fbfab33661d80f04d20289ec7e36e03eb3c2f215252498d12","observation_id":"770443fb-61ac-4be5-8c01-cf74987f1b98","resolution":{"observed_at":"2026-08-10T20:18:54.918800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-15T17:33:32.559096Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-10T20:18:54.521239Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.521239Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:3c3fd69b61db3f7bbd9bf020af64f68e3bb6be3c750d55355fc5ffc0ba48d411","observation_id":"2a4a229c-1ccd-45c0-b8af-fd9c29fe5b23","resolution":{"observed_at":"2026-08-10T20:18:54.521239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.526211Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.526211Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:c6c7978e50f0abd4665fe0ceec73faabff02820b226d52deab178b7d1fd152da","observation_id":"7f7b5860-2472-4b40-8864-ed50d4e6efbf","resolution":{"observed_at":"2026-08-10T20:18:54.526211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.894947Z","title":null,"venue":null,"work_id":"40c8d13d-44e3-4327-82c5-64794ea8308a","year":2016},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.531186Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:89333b2bc0e8ad0d2f3181b3de565ce1a02da267774edac4dd6c6e5e1a82992d","observation_id":"ec40481e-256f-4220-842e-04daaaf865ec","resolution":{"observed_at":"2026-08-10T20:18:54.898945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T20:18:54.536098Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.536098Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:b1b8dede53680292465729e11538281b8c711ce6de16978ff6a34eb8a9e5ea81","observation_id":"dc9436b0-d88b-4aaf-b255-8f4658f681c3","resolution":{"observed_at":"2026-08-10T20:18:54.536098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.883180Z","title":null,"venue":null,"work_id":"3847006d-3cc8-4041-9119-a2e246294aad","year":1993},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.540806Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:2d38ab18ec69456c0613c19cc0c59be84b3dfa80e8483d5a136081c9c008d370","observation_id":"75fa68d7-60f3-4b8e-9569-98e81b206c6e","resolution":{"observed_at":"2026-08-10T20:18:54.886996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.544530Z","title":"S.; and Barto, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.544530Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:052c6d09e4fa3db3b765c031094ffe4aa346b07a1e72e29a6b02502c13428557","observation_id":"4e44a114-19f9-443c-bcdc-59fd10dc69ab","resolution":{"observed_at":"2026-08-10T20:18:54.544530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.864643Z","title":null,"venue":null,"work_id":"5472fa41-9c90-428a-8682-202dfeda1898","year":2006},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.548253Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:b1f5c2d7c7cd50ad8e330dbe8a010152042e175d1a35e8d9823eefb811b1af5e","observation_id":"c9f5a6eb-b09b-4a80-a36a-25027dc3cdb8","resolution":{"observed_at":"2026-08-10T20:18:54.868629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.852780Z","title":null,"venue":null,"work_id":"4d860a40-1d95-40e1-884c-295c8fdc6bc6","year":2009},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.552125Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:088bff6bf6a23cb75ac33b2ada48618bad0bd6ff6ed699763935baa7cb4bf54a","observation_id":"bcb311e6-9896-4bfc-8f7f-95be05e65238","resolution":{"observed_at":"2026-08-10T20:18:54.856929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.556613Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.556613Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:39618216c529d38606f2145b368b661a8854ebadf2242972c47c16a2a71346f5","observation_id":"b9f883fe-e60d-4126-b993-85db6a1b726a","resolution":{"observed_at":"2026-08-10T20:18:54.556613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.834368Z","title":null,"venue":null,"work_id":"1b8b170d-306a-4e66-b65e-574f9cf1fc26","year":2016},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.560556Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:61cacc8de28cd8be3c1e5e729665f8bb418795ca606a5a6ac3190196fcfb7431","observation_id":"6772184f-8927-476e-9270-f26ec4f5dcf0","resolution":{"observed_at":"2026-08-10T20:18:54.838236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.822545Z","title":null,"venue":null,"work_id":"0c5785a6-8f98-41a2-a2bb-27dc0bb82ef6","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.564467Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:0442f10aa6b425b9cae491e2052f7ea72a848532b1dec6b5c9c55ca0e6ea4410","observation_id":"8f14e4ff-d88f-42af-8844-0836f186af89","resolution":{"observed_at":"2026-08-10T20:18:54.826468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.568957Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.568957Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:65e9022d0a56baa62af4d96bf9e6b5683fb88d1d11c38cfcf26034d8b60c0eba","observation_id":"b10087f3-6874-4fbb-b797-598d393d799c","resolution":{"observed_at":"2026-08-10T20:18:54.568957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-10T20:18:54.572916Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.572916Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:3bbbd8c16252ebb8330c57e7255040377f5adfe68a2cb8f974fe39bfd9d30457","observation_id":"68f62f4b-696f-4f6a-a182-d5eff2487548","resolution":{"observed_at":"2026-08-10T20:18:54.572916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07927","last_updated":"2024-10-10T13:54:11Z","snapshot_observed_at":"2026-08-18T08:52:48.495208Z","submitted_at":"2024-10-10T13:54:11Z","title":"Efficient Reinforcement Learning with Large Language Model Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07927","snapshot_observed_at":"2026-08-10T20:18:54.577941Z","title":"B.; and Wang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.577941Z"},"links":{"cited_paper":"/paper/2410.07927","citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:1372bf4c0ed2a106508d4f942452d54309d455abd04a231cee89b682a84624c1","observation_id":"09abbb62-d7e7-4cbf-a5e4-31b3312d8702","resolution":{"observed_at":"2026-08-10T20:18:54.577941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.804539Z","title":"S.; and Whiteson, S","venue":null,"work_id":"a59a1b85-df32-4a52-b28d-78345ac6d856","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.582535Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:2fe3ef4fb4b16ee169626ebc9ade057dff9cb13a72c106574e80665ae6f4499f","observation_id":"8ac8a3bf-ae73-47ec-af3a-33bd3bfe468c","resolution":{"observed_at":"2026-08-10T20:18:54.808252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.791262Z","title":null,"venue":null,"work_id":"649b5f4a-ddd9-4770-bb72-d1277c2aeb0f","year":2021},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.586455Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:aca77f93d33f8855f44f84ca14b303acad76b5d2b8fa293fb92dcd43c762b79f","observation_id":"3e886caf-b271-4b97-8be2-7cdd825d1b5d","resolution":{"observed_at":"2026-08-10T20:18:54.796128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.778078Z","title":null,"venue":null,"work_id":"10aa5b98-2667-4276-887e-90ee7c254795","year":2010},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.589974Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:5ebc1750162eac06239cb728e1ac6e94ae37892797637bb14810dd71feed73f6","observation_id":"232803de-c52a-4a92-9698-5c018e02d7a1","resolution":{"observed_at":"2026-08-10T20:18:54.783240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.593465Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.593465Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:5eab46ed8355c5246e2549eca9957cbe47ce3767db47be17c0f8291394024806","observation_id":"04656e05-a9f1-467f-8402-827a19e0fc9c","resolution":{"observed_at":"2026-08-10T20:18:54.593465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:54.597741Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T20:18:54.597741Z"},"links":{"citing_paper":"/paper/2501.09770"},"observation_digest":"sha256:9725afe4790f55af95c23169bce43258018a9db99de7040747f7fc241c514a82","observation_id":"fe2cf2fe-4046-41e1-a41b-8112427efa53","resolution":{"observed_at":"2026-08-10T20:18:54.597741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.09770","last_updated":"2025-01-15T19:00:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T04:08:52.360058Z","submitted_at":"2025-01-15T19:00:45Z","title":"EVAL: EigenVector-based Average-reward Learning"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2501.09770."}