{"as_of":"2026-08-15T21:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b7dd17863a31de3d00267b9e9453a5a1e1c65fb4c996d24af2ac716f7f6d267c","coverage":[{"denominator":137,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:32:00.321628Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21120/citation-record","integrity":"/paper/2607.21120/integrity","json":"/paper/2607.21120/citation-record.json","paper":"/paper/2607.21120"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.875467Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.875467Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:88fd3a2e1ccc0c5064896843e8e616a41534c5f58b4f988206f026ddcdefe8c1","observation_id":"0d576ef1-3c54-46f8-a215-e8038d754ee2","resolution":{"observed_at":"2026-08-01T08:31:59.875467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.941266Z","title":"Proceedings of the Annual Allerton Conference on Communication Control and Computing , volume=","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.941266Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:807cde6da149fe626f6cba2ae6b834433ac36b25549352250b11eca07ecd13f7","observation_id":"89ad0822-cd39-4f62-bac3-f86e9da0ee78","resolution":{"observed_at":"2026-08-01T08:31:59.941266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.959455Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.959455Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:d417759d7218d93304197a770e2eb693bbf86546559d083904d646ffb04a8cb2","observation_id":"168953f0-6a32-417d-bfcd-af6ae6f6bfb4","resolution":{"observed_at":"2026-08-01T08:31:59.959455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.963579Z","title":"Encyclopedia of optimization , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.963579Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:81ab1d9fab19325aacbc4c43c7d1264587efdc53e9e99a44d8a4a654c120ec35","observation_id":"6d845c01-746b-47f1-966e-0e53d0ecfa61","resolution":{"observed_at":"2026-08-01T08:31:59.963579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.967274Z","title":"SIAM Journal on Control and Optimization , volume=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.967274Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a9aab5b46a2719c39a958c1dc2777bdc567a9b0d623aa8bebe5bc057cca62412","observation_id":"6ff913ef-2cd1-485a-bcec-5f5a53f633a8","resolution":{"observed_at":"2026-08-01T08:31:59.967274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.971140Z","title":"2014 , publisher=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.971140Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f756658807809f797bb74d36252367c301e84256ff800327412ed00106cdd9d9","observation_id":"4eca9edb-f705-4c12-a22e-f817c376c717","resolution":{"observed_at":"2026-08-01T08:31:59.971140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.975224Z","title":"Icml , volume=","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.975224Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:2d6f24198f06fe210bf581548cc4aec48297c2971fdf3f10606cb2091f3c5052","observation_id":"3e2ea393-700c-429f-b70d-b14199f9460f","resolution":{"observed_at":"2026-08-01T08:31:59.975224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.979031Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.979031Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:d285f48a2bff0e6e55fd052cc1ee9d92fa4f72a0870947067c0169160fa24e12","observation_id":"24a885e4-2027-424b-92da-172acff2bafe","resolution":{"observed_at":"2026-08-01T08:31:59.979031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.982648Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.982648Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:2bac07b41317f59c080f929ebb60f4f1c82ed8adf5825d1bc037c7e15f80edea","observation_id":"f6a10bb8-6774-4bda-b855-17cafc65cb99","resolution":{"observed_at":"2026-08-01T08:31:59.982648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.986192Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.986192Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:028b732ede5608b45ec903e3d77c27571b772131e92c072edefa4b7340e0098f","observation_id":"6b71877e-3f6a-4bd5-9b98-d137d54281ef","resolution":{"observed_at":"2026-08-01T08:31:59.986192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.990312Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.990312Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a3e2f602254c64a78ec0a95c5d61261b1c635e7bb0e3c25f3934e1866bbe82ed","observation_id":"263ee092-3e03-4062-9e9e-909c61b4999c","resolution":{"observed_at":"2026-08-01T08:31:59.990312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.993871Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.993871Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f80ede98f683ff93e8d19bd060d0f39256fce66d268822d1fff5692ed9937f16","observation_id":"627abe0b-a60c-4105-9d41-fe90cd31776b","resolution":{"observed_at":"2026-08-01T08:31:59.993871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:31:59.997344Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T08:31:59.997344Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:3efd51dd6e69118a227e7c3b55c607475c468357c8155456497dee58c4450a5b","observation_id":"556e2d44-e21e-49a4-ba99-62f0046628ea","resolution":{"observed_at":"2026-08-01T08:31:59.997344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.000811Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.000811Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f1ff10694995ccc86e194cda462e245a3cd271d2133bc70e18671a676b428326","observation_id":"eecf4f26-7b8a-49dc-afb4-a778e941ba38","resolution":{"observed_at":"2026-08-01T08:32:00.000811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01224","last_updated":"2017-07-10T14:38:10Z","snapshot_observed_at":"2026-08-14T21:32:02.118456Z","submitted_at":"2016-11-03T23:21:32Z","title":"Sample Efficient Actor-Critic with Experience Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01224","snapshot_observed_at":"2026-08-01T08:32:00.004541Z","title":"arXiv preprint arXiv:1611.01224 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.004541Z"},"links":{"cited_paper":"/paper/1611.01224","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:378b1a2a5d750375680be65791edc67c8c0286055236b3ce6b98474c27f7e05d","observation_id":"ce7949ea-bda8-440d-a757-12be68097a8b","resolution":{"observed_at":"2026-08-01T08:32:00.004541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.008754Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.008754Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a47fa551205b1a2c1812f124a6b1ca1fd8594a34fe59459f40fe61a7dc40d000","observation_id":"5828abeb-c244-4eba-a000-1ce396dc76fe","resolution":{"observed_at":"2026-08-01T08:32:00.008754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.012890Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.012890Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:cbaeecf221763c9be26e190c03cda4a6a98e21acfc6820e67fc978ea45acf23a","observation_id":"a3b671b8-9caa-4f00-93d4-481db103dd08","resolution":{"observed_at":"2026-08-01T08:32:00.012890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-01T08:32:00.017066Z","title":"arXiv preprint arXiv:1506.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.017066Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:bb9513920f1b4290866e0b1d43e177ab2a69b80c490bdf13d8d441a2eea38965","observation_id":"2884477e-9bd9-4fb4-bfe4-a28089b53237","resolution":{"observed_at":"2026-08-01T08:32:00.017066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-08-15T11:34:31.786327Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-01T08:32:00.021033Z","title":"arXiv preprint arXiv:2403.03950 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.021033Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f8891999e0a695ad827d69d1cc44b7e3566e7f4a9b0bd2eb51f6097bf4fdaa55","observation_id":"703baa5e-1d4f-4cce-8642-aff5faab71a4","resolution":{"observed_at":"2026-08-01T08:32:00.021033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.024971Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.024971Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:13a1fc28d64d45e78d0df4c38d0927b3c5f275f897e42215f3ef109487a19a15","observation_id":"37065787-596c-4cad-b56d-92035bd7440e","resolution":{"observed_at":"2026-08-01T08:32:00.024971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12073","last_updated":"2023-08-01T08:47:59Z","snapshot_observed_at":"2026-08-15T09:45:13.197819Z","submitted_at":"2023-05-20T03:22:43Z","title":"GELU Activation Function in Deep Learning: A Comprehensive Mathematical Analysis and Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12073","snapshot_observed_at":"2026-08-01T08:32:00.028650Z","title":"arXiv preprint arXiv:2305.12073 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.028650Z"},"links":{"cited_paper":"/paper/2305.12073","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:bfe0bef916cc7e82651c568a8391467d452381dda9c14016767f008e1816c49e","observation_id":"aa85a5ad-22b0-4ee4-9e59-76013191138f","resolution":{"observed_at":"2026-08-01T08:32:00.028650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.032638Z","title":"Proceedings of the fourteenth international conference on artificial intelligence and statistics , pages=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.032638Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:76cc45e611981a5298e116060b0e6ce6f1b2a894583e5e7d2022ca9dbebd170a","observation_id":"c1400866-df0a-416e-bec8-1c231eeca9c0","resolution":{"observed_at":"2026-08-01T08:32:00.032638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00781","last_updated":"2024-04-30T22:52:33Z","snapshot_observed_at":"2026-08-14T22:49:59.714503Z","submitted_at":"2024-03-31T19:57:38Z","title":"Addressing Loss of Plasticity and Catastrophic Forgetting in Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00781","snapshot_observed_at":"2026-08-01T08:32:00.036570Z","title":"arXiv preprint arXiv:2404.00781 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.036570Z"},"links":{"cited_paper":"/paper/2404.00781","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f230f832562bbcf35db9c456c5b7eabc7dcdac5c1633b5c913d08ffc02b52710","observation_id":"e686bb41-4f0c-49ee-879c-b9acad96b0a8","resolution":{"observed_at":"2026-08-01T08:32:00.036570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.040297Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.040297Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:9bae51fad57c98ad0bd33e8d453db81ae4bf1c015ca5d7c4c66510ff1d0747fa","observation_id":"fed7bf0b-d4ad-40d7-b057-4cfa2823bd23","resolution":{"observed_at":"2026-08-01T08:32:00.040297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.043776Z","title":"Artificial Intelligence Review , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.043776Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b197edfe77ee977d3a50390d1374b980bbd22f9a2217182f6e2e7a4a1841fe54","observation_id":"fbbc1e17-b9c6-487b-b32b-7988d58fc7a3","resolution":{"observed_at":"2026-08-01T08:32:00.043776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.047292Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.047292Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:57e5332a7ecde64b47a8646ce50cf7158ed676ac17835cbe0519fe684a8ac6a2","observation_id":"09311152-f594-4260-a631-5809fb057196","resolution":{"observed_at":"2026-08-01T08:32:00.047292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.050748Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.050748Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:c301d85d45c5f8639e03c674d9d29183d3f0b27585c92b902598ab4f278feba7","observation_id":"e636a94a-449c-4a02-be9c-bcf9eb6cd3b3","resolution":{"observed_at":"2026-08-01T08:32:00.050748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.054368Z","title":"Conference on Lifelong Learning Agents , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.054368Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:1b9a6549b0b5541c6bfd786263d3c94a0554094f6d3c003094f94468c0839ae0","observation_id":"ce1e0e09-7922-4495-858d-3e8361cc5aef","resolution":{"observed_at":"2026-08-01T08:32:00.054368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.057772Z","title":"Deep Reinforcement Learning Workshop NeurIPS 2022 , year=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.057772Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:55128b96f920f11d9c40116b3c3c58d51b549aa34d94a567cb818d379b894e07","observation_id":"1aafc077-d9d7-4034-b4fb-f57b39db3ec5","resolution":{"observed_at":"2026-08-01T08:32:00.057772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02596","last_updated":"2025-02-04T09:13:43Z","snapshot_observed_at":"2026-08-12T23:52:41.535807Z","submitted_at":"2024-06-01T05:55:15Z","title":"Slow and Steady Wins the Race: Maintaining Plasticity with Hare and Tortoise Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02596","snapshot_observed_at":"2026-08-01T08:32:00.061250Z","title":"arXiv preprint arXiv:2406.02596 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.061250Z"},"links":{"cited_paper":"/paper/2406.02596","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:d367fd21e8facaf19800b939eec5aedcc1d05840ef435724b4e1ad140268ad1c","observation_id":"0165518d-d6da-4831-8f33-afa3515f3912","resolution":{"observed_at":"2026-08-01T08:32:00.061250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01151","last_updated":"2022-01-03T22:38:41Z","snapshot_observed_at":"2026-08-11T07:51:13.427751Z","submitted_at":"2021-06-02T13:41:02Z","title":"Towards Deeper Deep Reinforcement Learning with Spectral Normalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01151","snapshot_observed_at":"2026-08-01T08:32:00.065224Z","title":"arXiv preprint arXiv:2106.01151 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.065224Z"},"links":{"cited_paper":"/paper/2106.01151","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:1b67a94c36ab8a8f1b2e385397b640cb9f18d434aaab3981fe42c4529d1f767b","observation_id":"7f1d3b6c-9580-4f56-88e8-49c6ba2b11b2","resolution":{"observed_at":"2026-08-01T08:32:00.065224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05605","last_updated":"2024-03-25T10:20:18Z","snapshot_observed_at":"2026-08-14T17:16:08.864324Z","submitted_at":"2019-02-14T21:05:50Z","title":"CrossQ: Batch Normalization in Deep Reinforcement Learning for Greater Sample Efficiency and Simplicity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.05605","snapshot_observed_at":"2026-08-01T08:32:00.068959Z","title":"arXiv preprint arXiv:1902.05605 , volume=","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.068959Z"},"links":{"cited_paper":"/paper/1902.05605","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:50dc6906aa1b7f3234444d4b7a5d47a3b020469667d92ab8768bd4441a0e7e17","observation_id":"a9aed3e1-703b-4f9f-b7f4-13b961551d02","resolution":{"observed_at":"2026-08-01T08:32:00.068959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01800","last_updated":"2024-07-01T20:58:01Z","snapshot_observed_at":"2026-08-12T23:30:53.722145Z","submitted_at":"2024-07-01T20:58:01Z","title":"Normalization and effective learning rates in reinforcement learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01800","snapshot_observed_at":"2026-08-01T08:32:00.072591Z","title":"arXiv preprint arXiv:2407.01800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.072591Z"},"links":{"cited_paper":"/paper/2407.01800","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:7773149979d9f935937d1581a1b67c917064d1edabddb59bb09dcf8f45a8eb81","observation_id":"2ee1e8fa-4456-4f22-a346-809c2d6cfcd4","resolution":{"observed_at":"2026-08-01T08:32:00.072591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-08-12T21:01:12.961874Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-01T08:32:00.076211Z","title":"arXiv preprint arXiv:1502.03167 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.076211Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:687f8f05e8414f6236c6ee00216c0a94709e7d1a3e516553594447be009687df","observation_id":"e3fea54b-8c24-4758-b7bc-6a3619950a96","resolution":{"observed_at":"2026-08-01T08:32:00.076211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.079790Z","title":"Neurocomputing , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.079790Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:83b9f06bd666d266474a9743662a91ebe483bc8e8bf06cecdc70a291df75bc6d","observation_id":"2fbe75f2-7baf-41c0-a207-17914736a68f","resolution":{"observed_at":"2026-08-01T08:32:00.079790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.083170Z","title":"Neural Networks , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.083170Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:7ecf41c90a24f25dd2d2e608dfc7b597059e9110218dde853b6189879f6b5cf4","observation_id":"f194f467-42d2-4ee8-827b-b6aebe2545d3","resolution":{"observed_at":"2026-08-01T08:32:00.083170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.086518Z","title":"international conference on machine learning , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.086518Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:7ebedab22bf8045339123c13b7449a5b346bc3727eeaaa7285a14ff991f6075f","observation_id":"ce9b018b-db8a-4e07-af70-6a92758acf30","resolution":{"observed_at":"2026-08-01T08:32:00.086518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-01T08:32:00.090181Z","title":"arXiv preprint arXiv:1710.05941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.090181Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:e11335ae8f0c08b27693d37e7e7d860bf03f1255fec6c31a200a4ccdd116332f","observation_id":"7b6cfe6a-fb6c-4254-baed-806059435fd6","resolution":{"observed_at":"2026-08-01T08:32:00.090181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08681","last_updated":"2020-08-13T05:42:12Z","snapshot_observed_at":"2026-08-15T11:10:42.406459Z","submitted_at":"2019-08-23T06:22:06Z","title":"Mish: A Self Regularized Non-Monotonic Activation Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08681","snapshot_observed_at":"2026-08-01T08:32:00.094258Z","title":"arXiv preprint arXiv:1908.08681 , year=","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.094258Z"},"links":{"cited_paper":"/paper/1908.08681","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a7122cb6eacd8f87bade713257f8cecaed281aae250c98e5f10c86eb230c8f1f","observation_id":"69e7ea55-825c-44ec-94bc-4b07c8d6d11b","resolution":{"observed_at":"2026-08-01T08:32:00.094258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07289","last_updated":"2016-02-22T07:02:58Z","snapshot_observed_at":"2026-08-14T22:21:43.095256Z","submitted_at":"2015-11-23T15:58:05Z","title":"Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.07289","snapshot_observed_at":"2026-08-01T08:32:00.098155Z","title":"arXiv preprint arXiv:1511.07289 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.098155Z"},"links":{"cited_paper":"/paper/1511.07289","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:2c42bd8cebc9bbc117002008cc16fc7b04ba5068f35fe023a25d5130a7e6ca62","observation_id":"5f94e844-33cd-492e-abc0-801dc1a6dc51","resolution":{"observed_at":"2026-08-01T08:32:00.098155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.101828Z","title":"Neural networks , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.101828Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:de9f08ba406f342fe168bb6332d78604d6b80c13f801e46ee6ce26c01bddd701","observation_id":"0f8e689c-d8b4-4d65-93eb-53e3a72cd5d4","resolution":{"observed_at":"2026-08-01T08:32:00.101828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-01T08:32:00.105363Z","title":"arXiv preprint arXiv:1606.08415 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.105363Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:26e0a937254888d71769f5ee0e4eb8895d46630b2009d8c01441043426133150","observation_id":"361a3a9c-fa6a-4465-a9cd-af8c0e53c58f","resolution":{"observed_at":"2026-08-01T08:32:00.105363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.108946Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.108946Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:d6ac4573e8f3b5cfefb5f51f3f4ffc9a2bc9ecfdbd5a3262a26aee89b480fa7f","observation_id":"95f13796-f1e7-413d-a342-83d370c15dd5","resolution":{"observed_at":"2026-08-01T08:32:00.108946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.112314Z","title":"Proceedings of the 27th international conference on machine learning (ICML-10) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.112314Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:97bda37a37446465a13fc02639d4d583e5bbcb4c73a6533164cff451bbdc1927","observation_id":"1501f658-0aeb-4008-83b8-7faf5dee7618","resolution":{"observed_at":"2026-08-01T08:32:00.112314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.115769Z","title":"Neural networks: Tricks of the trade , pages=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.115769Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:64009f3237a9215ede04330d02ff9229fdd6e9d59a288523cd0c18a563558821","observation_id":"1aec2436-cccf-40cf-bc03-d43699e1fd0a","resolution":{"observed_at":"2026-08-01T08:32:00.115769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07550","last_updated":"2022-09-15T18:08:48Z","snapshot_observed_at":"2026-08-13T14:25:32.630472Z","submitted_at":"2022-09-15T18:08:48Z","title":"Human-level Atari 200x faster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07550","snapshot_observed_at":"2026-08-01T08:32:00.119566Z","title":"arXiv preprint arXiv:2209.07550 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.119566Z"},"links":{"cited_paper":"/paper/2209.07550","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:5299014e391039df94d6a8ac68a7c70925a1617d224fc7805baae68104d4805e","observation_id":"0760b783-0412-496b-b2b4-4389fc49f94d","resolution":{"observed_at":"2026-08-01T08:32:00.119566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.123537Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.123537Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:82e1c4c31b23b92689ab5fb847fe0237a4a7855c7bad94d736a003fcfb403792","observation_id":"13f1f862-a35b-4335-9da9-aea52dd2bd38","resolution":{"observed_at":"2026-08-01T08:32:00.123537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.127013Z","title":"Architecture , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.127013Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:20ea5fa88e4448592884181e3b518923eae16b288439c55e65be0200ef1313e4","observation_id":"134d768b-fcb2-454a-93de-23f4b2d7c7b7","resolution":{"observed_at":"2026-08-01T08:32:00.127013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.130583Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.130583Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:02ab66f5e4be01a35215733363d58bd2a57331799937f8962ec5b474a828a43a","observation_id":"0d006a61-58a3-465c-bdb6-9bbb8ba0591f","resolution":{"observed_at":"2026-08-01T08:32:00.130583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.134095Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.134095Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:1f8457e7c01c5704e0904f60ee407ea292d114f6eaf290bc65a2ef9ccd2091c4","observation_id":"822c9805-a5e3-4477-a1aa-446857be4522","resolution":{"observed_at":"2026-08-01T08:32:00.134095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.137830Z","title":"Journal of Artificial Intelligence Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.137830Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:eb7e498bfcbcc5540e2fec48de22d8109bd68d6819fc355a0f59a550ec41cb2c","observation_id":"c7f76e2d-c5d0-4b56-aa6e-a1c8e71175e7","resolution":{"observed_at":"2026-08-01T08:32:00.137830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.141273Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.141273Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:2ee87d8d577196f91d619a7598887bb89a44840fda86c32746f74ed21b4470dd","observation_id":"f3da6a7e-36b6-4c0f-80ae-bd353f47048b","resolution":{"observed_at":"2026-08-01T08:32:00.141273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.144667Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.144667Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:65b12741736f7f13b1e65bdc5e12dde01ebe47469cf4cc2e92dcea81a81ec4be","observation_id":"f71ec251-39bd-45e5-95ec-ecc982358084","resolution":{"observed_at":"2026-08-01T08:32:00.144667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.148174Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.148174Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:dd2f39937b2c93fb484c9a3972976d045414ff62b919286844ed925298581ae1","observation_id":"ff361e76-87f1-41bc-b688-c99bdd2178aa","resolution":{"observed_at":"2026-08-01T08:32:00.148174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.152574Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.152574Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:ec51d1427b7fa4a7413ed16995dcaa73e80b5f54575675109f09c576e3a2a908","observation_id":"9a5444a1-2a89-4c0d-9622-82af275e4a0b","resolution":{"observed_at":"2026-08-01T08:32:00.152574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.156266Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.156266Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:0fad76424db92f6f1a34264603cbd50cb383b140757a5c8a471deba2c056c895","observation_id":"ab3afdb4-f463-40a6-892e-669252d517b1","resolution":{"observed_at":"2026-08-01T08:32:00.156266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.159791Z","title":"Proceedings of the national academy of sciences , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.159791Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b305a9e55147969996304c7aef73428a3c11fcf8ed43388da9dbb4991429b7b9","observation_id":"955943a4-07ea-4bd6-bf5a-c4fd2dc28a64","resolution":{"observed_at":"2026-08-01T08:32:00.159791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.163313Z","title":"Trends in cognitive sciences , volume=","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.163313Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:e4b98b53b5669753a36a3c45b41c4f72ef31c1f14c5e30ce313c00fd91e27f63","observation_id":"940a953d-5fd4-40d4-a9c8-5eaa08987692","resolution":{"observed_at":"2026-08-01T08:32:00.163313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.167011Z","title":"Psychology of learning and motivation , volume=","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.167011Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:04a7a9926e3820d1c7dec620a426d2a8c404e87d7cc42e429b01d1735778ef27","observation_id":"61e57539-d895-4a47-a24c-5b280cef3086","resolution":{"observed_at":"2026-08-01T08:32:00.167011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.170733Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.170733Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:01f90febc8ce511d9f388a74d7bc6fc2d5826e46635e943c4e70ff07388c2c12","observation_id":"cce3e59a-081f-44df-b8ed-6f7323e379ab","resolution":{"observed_at":"2026-08-01T08:32:00.170733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18762","last_updated":"2024-02-29T00:02:33Z","snapshot_observed_at":"2026-08-13T04:07:47.729608Z","submitted_at":"2024-02-29T00:02:33Z","title":"Disentangling the Causes of Plasticity Loss in Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18762","snapshot_observed_at":"2026-08-01T08:32:00.174220Z","title":"arXiv preprint arXiv:2402.18762 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.174220Z"},"links":{"cited_paper":"/paper/2402.18762","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:78948cf449f3121a8387b5f2e1005b2778288ecd636c790bdca9efba0ad9e7c1","observation_id":"3b5d458b-1063-4dcb-bccc-c51a77e9e722","resolution":{"observed_at":"2026-08-01T08:32:00.174220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-15T21:31:17.600844Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-01T08:32:00.178072Z","title":"arXiv 2018 , author=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.178072Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:9dfdc9c96cca0a2a366885064e12438fa619ecdbbc76c5d263f0fca11f872706","observation_id":"5349a75b-0367-4be7-99c1-a8f420d5ca75","resolution":{"observed_at":"2026-08-01T08:32:00.178072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.182117Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.182117Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a58a39b0f34c2eec75c3f6a1a1a73eef15ea21af5af915387d5a39e7bd143223","observation_id":"9b2aa3fc-01cd-4289-94fb-86e6066690e7","resolution":{"observed_at":"2026-08-01T08:32:00.182117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.185583Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.185583Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:4a516dbb7d287730a980b878edbfc7697275c8f584f775d2a4e507601997085e","observation_id":"5bab5f36-7dde-4bc5-a4e4-7b791a3a692e","resolution":{"observed_at":"2026-08-01T08:32:00.185583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.189692Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.189692Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:05e47412b37e99c3164dad1e5992c39540f853622c612d1f78b0eca0ac8b12d6","observation_id":"3e77d4dc-1893-4572-8978-e232590ec55e","resolution":{"observed_at":"2026-08-01T08:32:00.189692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.193919Z","title":"1982 , publisher=","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.193919Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:d6cedba130f2a27c2e2ca91431394c028db59b831beeaea8c6c1cea794fe4475","observation_id":"f905dd73-dbce-46dd-8aaa-709414ac1df3","resolution":{"observed_at":"2026-08-01T08:32:00.193919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.198037Z","title":"The Sciences , volume=","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.198037Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:efc08767e31a997a31690a8af2e9262d587e072e80e264c5aa6aeac3cb1c9ba2","observation_id":"a20e86a1-d6c4-4a00-bf3f-c9228f381985","resolution":{"observed_at":"2026-08-01T08:32:00.198037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17688","last_updated":"2024-05-22T16:19:38Z","snapshot_observed_at":"2026-08-15T03:25:21.113109Z","submitted_at":"2023-10-26T17:59:06Z","title":"Managing extreme AI risks amid rapid progress","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17688","snapshot_observed_at":"2026-08-01T08:32:00.201622Z","title":"arXiv preprint arXiv:2310.17688 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.201622Z"},"links":{"cited_paper":"/paper/2310.17688","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f59f1fe8d15488295feee08f49e1470ce252a1c98aefcfb6727b38050f1b6ed3","observation_id":"54eb23d0-d9fa-4f13-9709-8c3b56151020","resolution":{"observed_at":"2026-08-01T08:32:00.201622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.205545Z","title":", author=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.205545Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f627684fc189457980f99c3baeada498ee6f60258a575ffe50ac89ad4f683aa9","observation_id":"9293439a-c9d3-4ab8-8e3f-40efcd7078d9","resolution":{"observed_at":"2026-08-01T08:32:00.205545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.208882Z","title":"Conference on robot learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.208882Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f715ac92e6641051e83d9d2cf7ff59ed3960deb11e6471eb748cf7dca3eb007f","observation_id":"df4aadff-d7cd-439b-b8bf-498d0f0bb0c0","resolution":{"observed_at":"2026-08-01T08:32:00.208882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.212934Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.212934Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:6fe5c2770bc11914fb402f3eef928df09f14052eb37bd92ba8757edad8f28180","observation_id":"1de3e3fb-fa70-4b25-adea-d7ade3043892","resolution":{"observed_at":"2026-08-01T08:32:00.212934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.216413Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.216413Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:23b3b48082a1d6c664319fcac221b1bf6c5fd6733a82643d2dc53b71ebf857c4","observation_id":"b3e32f87-a441-4263-809c-a4a3d86656f3","resolution":{"observed_at":"2026-08-01T08:32:00.216413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03698","last_updated":"2020-08-04T04:07:27Z","snapshot_observed_at":"2026-08-14T17:05:04.263031Z","submitted_at":"2019-03-08T23:32:17Z","title":"Skew-Fit: State-Covering Self-Supervised Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03698","snapshot_observed_at":"2026-08-01T08:32:00.219755Z","title":"arXiv preprint arXiv:1903.03698 , year=","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.219755Z"},"links":{"cited_paper":"/paper/1903.03698","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a1a8fa3bef675ec3a5f997431115fda62d8d02f02266ea7062c7becd548396d7","observation_id":"872d3749-4388-436a-9ef2-e6857443b901","resolution":{"observed_at":"2026-08-01T08:32:00.219755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.223730Z","title":"The 10th International Conference on Autonomous Agents and Multiagent Systems-Volume 2 , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.223730Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:109f0a8289d5c30236fb9240cc15978ccf63c46c3e0bc56f471fa4a137171cb1","observation_id":"a5828539-3fc5-4a2d-a8b3-61d5b956d002","resolution":{"observed_at":"2026-08-01T08:32:00.223730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.227892Z","title":"IJCAI , volume=","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.227892Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:d35ce42fea7a978cba976701bf8a963fd74a54303ce7f993eb7346f2cfd4abe3","observation_id":"28ed6931-b683-4459-9251-8af966a5ae8a","resolution":{"observed_at":"2026-08-01T08:32:00.227892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.231483Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.231483Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:18e2f75eee3e407ab7c5b26cc2f3f20d2c0cdf9baff142f2f9d98dd85c07d17a","observation_id":"29671395-2eda-4062-ac0f-869e1d2100a9","resolution":{"observed_at":"2026-08-01T08:32:00.231483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.235004Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.235004Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:ad804a50606f66e6c12bd07e69f19f9fe62f93982611bbbf131be5be6b8caa9e","observation_id":"fabaea2b-a096-4435-85e9-743e34db4f37","resolution":{"observed_at":"2026-08-01T08:32:00.235004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.238701Z","title":"1988 , publisher=","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.238701Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:0e931214ef5fce38864aac0de9cca1a348542417a1eb33880c3adc6d5f53b703","observation_id":"a1c8e256-683b-4ecb-80f0-580dca024ff5","resolution":{"observed_at":"2026-08-01T08:32:00.238701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.242507Z","title":"arXiv preprint arXiv:2401.12963 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.242507Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:15884db5e08158b5d7601022a215ea7af4cc3d3474b3cb5afa00ce753bf07821","observation_id":"03bddbdd-0e0b-48df-8155-1c1800180def","resolution":{"observed_at":"2026-08-01T08:32:00.242507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.246419Z","title":"Foundations and Trends","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.246419Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:375af8a65c2da69af881d4e219250a81556d5925644cf8f32aa59dcdbd59f609","observation_id":"9c5a4008-b189-42fc-a473-e01a54a376d4","resolution":{"observed_at":"2026-08-01T08:32:00.246419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.250330Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.250330Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:69d8552b3a3d3831c633a0df9d574c7de6823ccae3f41fd5b885d477e9873890","observation_id":"a20579ec-c3f1-41cf-a8c7-4fcd1674e705","resolution":{"observed_at":"2026-08-01T08:32:00.250330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-01T08:32:00.254106Z","title":"arXiv preprint arXiv:1312.5602 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.254106Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:b546ffa096c00f9b1a6f6eeb72486aa1e7e823fc1ad40202eaa8f6e01c7a1061","observation_id":"60afc1df-3fcf-4008-a02c-480292e4773c","resolution":{"observed_at":"2026-08-01T08:32:00.254106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.258113Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.258113Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:6ad1c8a4de8807fd623db091d915c80a7311e01ce0d0fdd14d8ffbfa2369a690","observation_id":"4b6b982a-b5a7-4997-b16f-8443704ff472","resolution":{"observed_at":"2026-08-01T08:32:00.258113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.07528","last_updated":"2020-02-11T00:56:50Z","snapshot_observed_at":"2026-08-15T13:00:00.553491Z","submitted_at":"2019-09-17T00:17:02Z","title":"Emergent Tool Use From Multi-Agent Autocurricula","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.07528","snapshot_observed_at":"2026-08-01T08:32:00.261730Z","title":"arXiv preprint arXiv:1909.07528 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.261730Z"},"links":{"cited_paper":"/paper/1909.07528","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:ce7dfcd953c91738c43a58abb4b6c1bf6d0e7f04795fa5b2b1acc4ca15bcc3eb","observation_id":"15c762ce-cbed-484b-9ce4-2bd1bccc9165","resolution":{"observed_at":"2026-08-01T08:32:00.261730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.265399Z","title":"Artificial Intelligence , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.265399Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:70ac321ff985e243e35cb6a3c6556a329c093ba8e495b573cb53637208a25525","observation_id":"2be6bcf7-f9f2-41ec-a4d5-13da87948a77","resolution":{"observed_at":"2026-08-01T08:32:00.265399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.268821Z","title":"Artificial General Intelligence: 4th International Conference, AGI 2011, Mountain View, CA, USA, August 3-6, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.268821Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:562888adc087f05bd89d610fb6d1f7a8cd012e5192820753a1e351a60b7252a4","observation_id":"1061a391-ed08-4731-953d-9dafce161790","resolution":{"observed_at":"2026-08-01T08:32:00.268821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.272475Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.272475Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:67a7cb44cf94b12795f1cbb71a89c9674c39a9ad7222e4da68abddef89dfdfc3","observation_id":"7606a3c0-30d9-4f89-b430-a2bc481791c9","resolution":{"observed_at":"2026-08-01T08:32:00.272475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.276036Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.276036Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:79d4990f8201bc3c0080120abb821e2ddfb9ddec6e2e98b9de81eb9ba761531d","observation_id":"1eb059e8-0796-49fb-a654-29e0d6b39291","resolution":{"observed_at":"2026-08-01T08:32:00.276036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.279641Z","title":"Artificial intelligence safety and security , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.279641Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:633ffa5e7c797dda1a9c2b7eb728dc648d9f88055f444b6f5e5d580728d230d0","observation_id":"ee961421-1064-4aa3-a697-2f377c46547e","resolution":{"observed_at":"2026-08-01T08:32:00.279641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.283336Z","title":"2017 , publisher=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.283336Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:1a57a4b0261c4ced324629b641aa9c5303f949eb12e66a976b3287cdbbb7e520","observation_id":"53298e9f-92e3-463e-ba98-c3f06e25e72c","resolution":{"observed_at":"2026-08-01T08:32:00.283336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09883","last_updated":"2017-11-28T17:40:36Z","snapshot_observed_at":"2026-08-14T20:09:41.945044Z","submitted_at":"2017-11-27T18:57:13Z","title":"AI Safety Gridworlds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.09883","snapshot_observed_at":"2026-08-01T08:32:00.287868Z","title":"arXiv preprint arXiv:1711.09883 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.287868Z"},"links":{"cited_paper":"/paper/1711.09883","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:508058fcb5493ad60146c34eb581743c88cabf4d130b7fac7c621e994ce8c71d","observation_id":"ec5365c9-ff96-483e-9d42-16b574ccc378","resolution":{"observed_at":"2026-08-01T08:32:00.287868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.291888Z","title":"2019 , publisher=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.291888Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:8ba88f2c17fada5937f64019230f88fc64e94a84cdd91502a9761519fee1f273","observation_id":"9bb48be5-96cf-42bf-ae44-b9f427458deb","resolution":{"observed_at":"2026-08-01T08:32:00.291888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.295444Z","title":"Global catastrophic risks , volume=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.295444Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:1ece35a693d0eed8763ccca2d3ecf3633a2207537eac135756ba7ec5a27e6857","observation_id":"9673b897-fbf1-46db-8c1e-78c51b7eee10","resolution":{"observed_at":"2026-08-01T08:32:00.295444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.299191Z","title":"Road vehicle automation , pages=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.299191Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:76b321637f010cd95e92b9bc0ec2cceda552987a8cc5b89cd605870789136574","observation_id":"16b3f2d2-41c9-432c-bbbd-af638e9c4a59","resolution":{"observed_at":"2026-08-01T08:32:00.299191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.303287Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.303287Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:953d6a3b1b99c727a8396d5bc68efc68ac328463b0521dd44dd0934192eb91b3","observation_id":"3457083a-a7bc-47d0-b118-90ca9cd88342","resolution":{"observed_at":"2026-08-01T08:32:00.303287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-01T08:32:00.307147Z","title":"arXiv preprint arXiv:1606.06565 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.307147Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:f645b4fb1f7f7cba56aa57b09b2170c7b7f6a4f9ecc33b4e777b734139922271","observation_id":"0c386f22-0c3d-4de4-b447-e946b142f27d","resolution":{"observed_at":"2026-08-01T08:32:00.307147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.310932Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.310932Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:a597adb740089452b0d6785d26088c5551d0d544ef364a3b83cbde369a2fd22e","observation_id":"b9183977-9950-4e78-9b5a-21aaac9b632f","resolution":{"observed_at":"2026-08-01T08:32:00.310932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.314338Z","title":"Science , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.314338Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:72ebb88cee7a1cd7ff7fdd872fb54691a61743c002b1f47f3057c54b60a806c2","observation_id":"297e3ac7-aa16-4b16-8413-29e82563c011","resolution":{"observed_at":"2026-08-01T08:32:00.314338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.318171Z","title":"Conference on robot learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.318171Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:2490d5411d80eb51d57931a91394820c713f40f9e1974bfadba7c5d993aee61f","observation_id":"d7f05819-c79a-4064-a650-7a7036c51ad2","resolution":{"observed_at":"2026-08-01T08:32:00.318171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:32:00.321628Z","title":"The International Journal of Robotics Research , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.321628Z"},"links":{"citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:935e320c2f7f31f0081d4e18bcf31eb15d6439e27ca5a7418c0a87938ac14835","observation_id":"57340d75-440f-4cd2-ac37-e662ef3b1303","resolution":{"observed_at":"2026-08-01T08:32:00.321628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T04:22:32.472683Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":137},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 137 outbound references and 0 inbound Pith citation observations for arXiv:2607.21120."}