{"as_of":"2026-08-15T02:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:486a8efbce32f70c250d12f5a1cb7c72f41a57652b0d47558673264f77a1eab1","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:20:23.254360Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:15:24.591790Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T07:55:33.101030Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-08-14T11:15:24.591790Z","title":"Behaviour suite for reinforcement learning.CoRR, abs/1908.03568, 2016.https://arxiv.org/abs/1908.03568","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.09453","last_updated":"2020-09-26T11:49:05Z","snapshot_observed_at":"2026-08-14T11:08:51.634209Z","submitted_at":"2019-08-26T03:31:35Z","title":"OpenSpiel: A Framework for Reinforcement Learning in Games","version":6},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T11:15:24.591790Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/1908.09453"},"observation_digest":"sha256:490f1515c886e0e91656c67174e0bfaaed8b974f18ffdac2923ec4f3d24c4d7e","observation_id":"5ed7b8d2-1fe1-46ae-b36b-4e6f8f435c81","resolution":{"observed_at":"2026-08-14T11:15:24.591790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1908.03568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Conway, A., Cowan, N., Donkin, C., Farrell, S., Hitch, G","venue":null,"work_id":"7927ac5a-af41-429f-9403-6ab889c8b5c4","year":2018},"citing_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T13:05:34.106110Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/1911.01547"},"observation_digest":"sha256:a057f7c6fad698b8b4ddc7da4e86376961f565f82fdce5c6e513428a27d7077e","observation_id":"d9859f81-6607-459b-bcdf-32844123fbe2","resolution":{"observed_at":"2026-05-12T13:05:34.208295Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1908.03568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Conway, A., Cowan, N., Donkin, C., Farrell, S., Hitch, G","venue":null,"work_id":"7927ac5a-af41-429f-9403-6ab889c8b5c4","year":2018},"citing_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T09:08:21.677362Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/2301.04104"},"observation_digest":"sha256:cbdf96b321a757032bcf651d88bcb3e0a7bbe581f72d68fcb28b992282c87e2e","observation_id":"377a83e6-8a25-40b2-9962-1b9c8b7d8b63","resolution":{"observed_at":"2026-05-11T09:08:22.279884Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1908.03568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Conway, A., Cowan, N., Donkin, C., Farrell, S., Hitch, G","venue":null,"work_id":"7927ac5a-af41-429f-9403-6ab889c8b5c4","year":2018},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:585076009df48140b979eeb306bb7bfb0acd61d1e178340103f63e424c76eabc","observation_id":"951569ed-fd37-43a5-82d5-0f64b2f2ceb3","resolution":{"observed_at":"2026-05-11T17:29:49.477736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1908.03568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Conway, A., Cowan, N., Donkin, C., Farrell, S., Hitch, G","venue":null,"work_id":"7927ac5a-af41-429f-9403-6ab889c8b5c4","year":2018},"citing_paper":{"arxiv_id":"2502.20349","last_updated":"2026-05-22T15:40:34Z","snapshot_observed_at":"2026-08-14T14:51:23.390306Z","submitted_at":"2025-02-27T18:20:54Z","title":"Naturalistic Computational Cognitive Science: Towards generalizable models and theories that capture the full range of natural behavior","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T02:38:26.196000Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/2502.20349"},"observation_digest":"sha256:f3fe0f18d2789bf8287331b3f3d7da15d54b50e5667e245d6bb4a0fb79438631","observation_id":"2a01d860-ebdf-40f6-b019-47e29a6d6f97","resolution":{"observed_at":"2026-05-23T02:42:26.399717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1908.03568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Conway, A., Cowan, N., Donkin, C., Farrell, S., Hitch, G","venue":null,"work_id":"7927ac5a-af41-429f-9403-6ab889c8b5c4","year":2018},"citing_paper":{"arxiv_id":"2502.20349","last_updated":"2026-05-22T15:40:34Z","snapshot_observed_at":"2026-08-14T14:51:23.390306Z","submitted_at":"2025-02-27T18:20:54Z","title":"Naturalistic Computational Cognitive Science: Towards generalizable models and theories that capture the full range of natural behavior","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T07:53:48.604436Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/2502.20349"},"observation_digest":"sha256:312ffa0b0c585defbf9085a17c6b8a9cedfe65743db68c93216b105ba5b6e274","observation_id":"5c2754d1-30f3-459f-8ed0-24229f650e6d","resolution":{"observed_at":"2026-05-25T07:55:33.104117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-08-06T18:18:46.955783Z","title":"Behaviour suite for reinforcement learning","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.08718","last_updated":"2025-07-11T16:19:45Z","snapshot_observed_at":"2026-08-15T01:13:54.046346Z","submitted_at":"2025-07-11T16:19:45Z","title":"On the Effect of Regularization in Policy Mirror Descent","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:18:46.955783Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/2507.08718"},"observation_digest":"sha256:2f93a4c42cc2498cd815bf067c840401e5d236697b15d4be169ddeb3b1e4217b","observation_id":"68b25ed3-1791-403b-a4c5-2f4cfd4edf95","resolution":{"observed_at":"2026-08-06T18:18:46.955783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-08-06T17:46:34.092700Z","title":"Behaviour suite for reinforcement learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10183","last_updated":"2025-07-22T16:14:41Z","snapshot_observed_at":"2026-08-10T07:07:52.923463Z","submitted_at":"2025-07-14T11:47:43Z","title":"T-GRAB: A Synthetic Diagnostic Benchmark for Learning on Temporal Graphs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:34.092700Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/2507.10183"},"observation_digest":"sha256:11d09fd090fbaa260f75a813fbb067f4907611852c6eb1a1c1308b0df9ba5919","observation_id":"185d5759-6035-4f49-b900-61b64e9109cb","resolution":{"observed_at":"2026-08-06T17:46:34.092700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-08-04T12:54:40.629746Z","title":"Behaviour suite for reinforcement learning.arXiv preprint arXiv:1908.03568,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2510.01764","last_updated":"2026-07-06T14:44:27Z","snapshot_observed_at":"2026-08-13T14:58:33.249816Z","submitted_at":"2025-10-02T07:56:47Z","title":"Octax: Accelerated CHIP-8 Arcade Environments for Reinforcement Learning in JAX","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T12:54:40.629746Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/2510.01764"},"observation_digest":"sha256:d943d5d7f5cd65578d557662138a3e4e9107757a98b90b5a631b7a69c9498af2","observation_id":"d5957897-8f7f-41ed-977c-ebc1b3adf9fc","resolution":{"observed_at":"2026-08-04T12:54:40.629746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1908.03568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Conway, A., Cowan, N., Donkin, C., Farrell, S., Hitch, G","venue":null,"work_id":"7927ac5a-af41-429f-9403-6ab889c8b5c4","year":2018},"citing_paper":{"arxiv_id":"2605.11694","last_updated":"2026-05-12T07:51:18Z","snapshot_observed_at":"2026-08-14T16:49:14.775442Z","submitted_at":"2026-05-12T07:51:18Z","title":"Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T07:27:12.302109Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/2605.11694"},"observation_digest":"sha256:9ec7693dcda6617ab99f253a49fce5f9484316388cebb7a683f473b6c2d147fa","observation_id":"1e822db9-e1df-4e89-a247-15ccab53491b","resolution":{"observed_at":"2026-05-13T07:27:29.066216Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.03568/citation-record","integrity":"/paper/1908.03568/integrity","json":"/paper/1908.03568/citation-record.json","paper":"/paper/1908.03568"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-14T14:20:23.190946Z","title":"Pablo Samuel Castro, Subhodeep Moitra, Carles Gelada, Saurabh Kumar, and Marc G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.190946Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:0e9a4ef25b227b2b5df955601f2e3ec3a76992860385ec4e961f9e2845a5abc4","observation_id":"9baa8757-7f4f-4e32-b44f-144137e4f63f","resolution":{"observed_at":"2026-08-14T14:20:23.190946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:20:23.391930Z","title":"The gains are most extreme in the exploration tasks, where ensemble sizes less than 10 are not able to solve large ‘deep sea’ tasks, but larger ensembles solve them reliably","venue":null,"work_id":"d507eaf4-dbc3-44e6-9650-cc554b6964dc","year":2017},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.254360Z"},"links":{"citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:2998eb52d2a0c748104facae2c61500d5118482a4fc2a15f5855e528a5718c60","observation_id":"dad1c6a5-5942-4296-9177-84a3850e4311","resolution":{"observed_at":"2026-08-14T14:20:23.396278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06009","last_updated":"2017-12-01T03:18:14Z","snapshot_observed_at":"2026-08-14T20:32:08.654033Z","submitted_at":"2017-09-18T15:32:57Z","title":"Revisiting the Arcade Learning Environment: Evaluation Protocols and Open Problems for General Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06009","snapshot_observed_at":"2026-08-14T14:20:23.214929Z","title":"Revisiting the Arcade Learning Environment: Evaluation protocols and open problems for general agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.214929Z"},"links":{"cited_paper":"/paper/1709.06009","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:0defde1f4798d23a04038329a564f6a3dd6b460f9c69dd2749605a995f0c6364","observation_id":"f51aef5a-e9bd-4967-b021-8fccafb0e26b","resolution":{"observed_at":"2026-08-14T14:20:23.214929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07608","last_updated":"2019-09-23T18:29:02Z","snapshot_observed_at":"2026-08-15T00:44:00.444975Z","submitted_at":"2017-03-22T11:53:53Z","title":"Deep Exploration via Randomized Value Functions","version":5},"cited_work":{"arxiv_id":"1703.07608","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.07608","snapshot_observed_at":"2026-08-14T14:20:23.319298Z","title":"Deep Exploration via Randomized Value Functions","venue":"stat.ML","work_id":"09d5dcac-a7af-42dc-a334-a337cef3cb36","year":2017},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.222747Z"},"links":{"cited_paper":"/paper/1703.07608","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:ec260f8a268589bd8cc48253daa1f86641e76979a9156044f774f6ba95f312b0","observation_id":"fd825e92-858d-4893-bc24-b253875fdb47","resolution":{"observed_at":"2026-08-14T14:20:23.325375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:20:23.239196Z","title":"doi: 10.1126/science.aar6404","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.239196Z"},"links":{"citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:7a65e46aa3864aa9a33986432970c9f5c072cd039e4d52d6e0ad68bab601a39c","observation_id":"e6fb266a-a168-4062-94b2-22308bf15fc2","resolution":{"observed_at":"2026-08-14T14:20:23.239196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.02057","last_updated":"2019-07-03T17:53:02Z","snapshot_observed_at":"2026-08-12T19:51:32.307910Z","submitted_at":"2019-07-03T17:53:02Z","title":"Benchmarking Model-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.02057","snapshot_observed_at":"2026-08-14T14:20:23.249856Z","title":"12 Published as a conference paper at ICLR 2020 A Experiment summary This appendix outlines the experiments that make up the bsuite 2019 release","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.249856Z"},"links":{"cited_paper":"/paper/1907.02057","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:cf7a8545f0ec88bdba71b0f2180a85ab559df45458a48d7a20940a40b5783b0d","observation_id":"2917ceb3-dc54-44e5-bf51-c3889ecbe66b","resolution":{"observed_at":"2026-08-14T14:20:23.249856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:20:23.207094Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":1952,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.207094Z"},"links":{"citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:5aaf66f4267a5de09760c9ebd071d840f9af760bb73b09f0177642a65e7fb57a","observation_id":"e1a1203d-1320-4a14-bb38-64e0581af1a1","resolution":{"observed_at":"2026-08-14T14:20:23.207094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.02038","last_updated":"2020-07-14T22:22:04Z","snapshot_observed_at":"2026-08-14T20:49:09.757871Z","submitted_at":"2017-07-07T05:22:16Z","title":"A Tutorial on Thompson Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.02038","snapshot_observed_at":"2026-08-14T14:20:23.235177Z","title":"A tutorial on Thompson sampling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":1958,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.235177Z"},"links":{"cited_paper":"/paper/1707.02038","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:e2fec19c024accab4907fa1aa14220f28970f0f711c2cfb43b788bd6db6a25a8","observation_id":"ab5da487-e568-4ca8-bd3b-a0e00ea15dd3","resolution":{"observed_at":"2026-08-14T14:20:23.235177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:20:23.426357Z","title":"MIPLIB 2017,","venue":null,"work_id":"410dd725-1f88-49f6-bf5b-c3c061fb3038","year":2017},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":1961,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.219154Z"},"links":{"citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:cca81ffa60280fb85d565712242ff69db23f3f3817690046d7026df20597cc74","observation_id":"e9a57811-37d3-4691-9b75-de3f609fa628","resolution":{"observed_at":"2026-08-14T14:20:23.430030Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03801","last_updated":"2016-12-13T12:19:48Z","snapshot_observed_at":"2026-08-14T21:25:55.714417Z","submitted_at":"2016-12-12T17:32:49Z","title":"DeepMind Lab","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03801","snapshot_observed_at":"2026-08-14T14:20:23.172599Z","title":"Deepmind lab.arXiv preprint arXiv:1612.03801,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.172599Z"},"links":{"cited_paper":"/paper/1612.03801","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:b0cbaed16a2e1ef6cc348a6d46b1bc28ad03b4a83420a3396bb9b8e6f7c78465","observation_id":"8d35d5b1-7b79-4344-b655-8ca6ba06e2e6","resolution":{"observed_at":"2026-08-14T14:20:23.172599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:20:23.403145Z","title":"doi: 10.1109/ MCSE.2007.53","venue":null,"work_id":"474fec4d-20f8-4019-9ad3-fd394879b7ca","year":2007},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.231779Z"},"links":{"citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:fecba1575e7204d806406ea4f729e0d44bf0130a858d75630868e3830affbd0f","observation_id":"68cf11e6-f440-4901-b252-7deaf61de2db","resolution":{"observed_at":"2026-08-14T14:20:23.406857Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-14T14:20:23.242776Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.242776Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:022b38ff250217283bc9ff80a2e75c2bec674167558ec0b1f204b74a9a1e4ab0","observation_id":"eeab421e-c2d9-4e84-9da8-1404c2f0436f","resolution":{"observed_at":"2026-08-14T14:20:23.242776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:20:23.441695Z","title":"Large-scale machine learning with stochastic gradient descent","venue":null,"work_id":"3e144f85-69fa-4123-84f3-51d70c96fb5b","year":2010},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.182585Z"},"links":{"citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:c610c1421dffe62845bcf4c14af4e09387d2abed00d70fb82cb5f4ea1b33d6da","observation_id":"270ae6cc-5677-4ca5-a524-b90d898b103c","resolution":{"observed_at":"2026-08-14T14:20:23.446386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T14:20:23.210769Z","title":"10 Published as a conference paper at ICLR 2020 Alex Krizhevsky, Ilya Sutskever, and Geoﬀrey E Hinton","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.210769Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:4a19e7f3270d9f5d53858e819ddb3470f42cd8ce4e56acc3bad2febc3ccef093","observation_id":"48945cdc-2f9c-451c-8c52-428099f88c79","resolution":{"observed_at":"2026-08-14T14:20:23.210769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.11118","last_updated":"2019-09-10T19:51:04Z","snapshot_observed_at":"2026-08-14T17:37:29.631658Z","submitted_at":"2018-12-28T17:15:38Z","title":"Reconciling modern machine learning practice and the bias-variance trade-off","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.11118","snapshot_observed_at":"2026-08-14T14:20:23.177818Z","title":"Reconciling modern machine learning and the bias-variance trade-oﬀ","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.177818Z"},"links":{"cited_paper":"/paper/1812.11118","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:9be14b0a9a6a9542b46e9467e2f5ba88c48dfb671fd05cc389d30f53be2b76a4","observation_id":"4a79a638-af2f-43a4-8b98-05ea01fa4bde","resolution":{"observed_at":"2026-08-14T14:20:23.177818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-08-14T20:31:55.426676Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-14T14:20:23.202658Z","title":"org/abs/1709.06560","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.202658Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:2259d0dda2c517f8e34075ccfdcde55f5b3aa8d06015832dfbfc7cc43be6e877","observation_id":"12e9faa9-8ba1-4236-82d7-9c0ef3e8cfaf","resolution":{"observed_at":"2026-08-14T14:20:23.202658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06110","last_updated":"2018-12-14T19:03:38Z","snapshot_observed_at":"2026-08-14T19:03:45.460809Z","submitted_at":"2018-12-14T19:03:38Z","title":"Dopamine: A Research Framework for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06110","snapshot_observed_at":"2026-08-14T14:20:23.194486Z","title":"org/abs/1812.06110","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.194486Z"},"links":{"cited_paper":"/paper/1812.06110","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:38e87a04b0845181c50c12ae136decd5c1422d3d25104033e1ed0864b5c2885f","observation_id":"3ba3e373-2518-4a4d-82c7-e0e053a0e4b1","resolution":{"observed_at":"2026-08-14T14:20:23.194486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:20:23.414801Z","title":null,"venue":null,"work_id":"fbff1698-5b9c-4ac1-b766-1facb554c12d","year":2020},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.227474Z"},"links":{"citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:927461120ff5c454882c6e961456cd5404d3ae82e01d3e830aea2eaa81c7fe06","observation_id":"980b90bc-3cbc-4cf6-a236-f6d72422b264","resolution":{"observed_at":"2026-08-14T14:20:23.419055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T19:04:39.625061Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":13,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 10 inbound Pith citation observations for arXiv:1908.03568."}