{"as_of":"2026-08-09T23:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf4b65e0505b55057f4cabc3895679e759d1c1bc1ea1d524ac469b66ab9c5c6b","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:10:08.987854Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T20:00:55.197662Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"cited_work":{"arxiv_id":"2506.00563","doi":"10.48550/arxiv.2506.00563","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding Behavioral Metric Learning","venue":"ArXiv.org","work_id":"c8a47dac-dc19-49be-9895-b11325b58867","year":2025},"citing_paper":{"arxiv_id":"2605.00787","last_updated":"2026-05-01T17:09:58Z","snapshot_observed_at":"2026-08-07T01:51:48.603878Z","submitted_at":"2026-05-01T17:09:58Z","title":"SAVGO: Learning State-Action Value Geometry with Cosine Similarity for Continuous Control","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-09T20:00:55.197662Z"},"links":{"cited_paper":"/paper/2506.00563","citing_paper":"/paper/2605.00787"},"observation_digest":"sha256:93cdb9ed3138503358db4b5bc032db498f29acd75921deee87383443b4687f90","observation_id":"e2946632-5655-4d00-b5b1-88a0e843cd76","resolution":{"observed_at":"2026-05-09T20:01:36.584993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00563/citation-record","integrity":"/paper/2506.00563/integrity","json":"/paper/2506.00563/citation-record.json","paper":"/paper/2506.00563"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2101.05265","last_updated":"2021-03-18T13:58:01Z","snapshot_observed_at":"2026-07-06T10:32:19.938039Z","submitted_at":"2021-01-13T18:55:43Z","title":"Contrastive Behavioral Similarity Embeddings for Generalization in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05265","snapshot_observed_at":"2026-08-07T12:09:58.708141Z","title":"Contrastive behavioral similarity embeddings for generalization in reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:58.708141Z"},"links":{"cited_paper":"/paper/2101.05265","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:bc43938e5a0730b6de74de24560dc70f70bd0deb5a5f61a02b5cd1356e6188e3","observation_id":"e14aaef1-00af-43f1-bff2-4e5f80decd75","resolution":{"observed_at":"2026-08-07T12:09:58.708141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:18.590270Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":"a3d0f66e-3d47-49dd-932a-6e342537e620","year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:58.870069Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:acedc493850080dc5ef1c2eb2aa4b5b04683dcc1181444d923554ec58eed2b77","observation_id":"ac61ba63-31a3-4367-8b37-f9181c824f60","resolution":{"observed_at":"2026-08-07T12:10:18.711466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T12:09:58.996705Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:58.996705Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:9973220302b87ac0d1e9b317187eaf100e926fa03dd2f0471518a52acf6ce75d","observation_id":"5716f765-391f-408b-9072-d16b236b6e21","resolution":{"observed_at":"2026-08-07T12:09:58.996705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05605","last_updated":"2024-03-25T10:20:18Z","snapshot_observed_at":"2026-08-03T12:33:55.627333Z","submitted_at":"2019-02-14T21:05:50Z","title":"CrossQ: Batch Normalization in Deep Reinforcement Learning for Greater Sample Efficiency and Simplicity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.05605","snapshot_observed_at":"2026-08-07T12:09:59.140424Z","title":"Crossq: Batch normalization in deep reinforcement learning for greater sample efficiency and simplicity","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:59.140424Z"},"links":{"cited_paper":"/paper/1902.05605","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:43ae19d337f5dcb72ca1170d8f3ce3c239277ae791dbd332f254b3db483b4a13","observation_id":"86a6e4d0-061c-4591-9a1b-8bbe15e8a26a","resolution":{"observed_at":"2026-08-07T12:09:59.140424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12929","last_updated":"2019-04-03T11:20:50Z","snapshot_observed_at":"2026-08-04T13:29:45.319832Z","submitted_at":"2018-11-30T18:29:29Z","title":"Online Abstraction with MDP Homomorphisms for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.12929","snapshot_observed_at":"2026-08-07T12:09:59.274698Z","title":"Online abstraction with mdp homomorphisms for deep learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:59.274698Z"},"links":{"cited_paper":"/paper/1811.12929","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:09941e90f411bba7ce76163f8307bea5315934187c17e2a762ce6e2b88cc784e","observation_id":"8bb28be9-cd18-4ca9-addf-f0d8e9b72f07","resolution":{"observed_at":"2026-08-07T12:09:59.274698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:59.392893Z","title":"Scalable methods for computing state similarity in deterministic markov decision processes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:59.392893Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:5a9b9e705ece4217f7ca8281de73daa701df2591fd4e41eaea841fe132275a4f","observation_id":"55d96dde-b654-44c2-9817-6697f6912d7f","resolution":{"observed_at":"2026-08-07T12:09:59.392893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:18.307067Z","title":"Mico: Improved representations via sampling-based state similarity for markov decision processes","venue":null,"work_id":"74cd1112-6cc8-40e9-8d3a-ede78d801051","year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:59.461170Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:7fd0ad8953cc6bfc62363d6f534b03a961727cbffdecbc482d95e0f7b721debd","observation_id":"bd4db822-0655-46a0-b212-3b04738494a3","resolution":{"observed_at":"2026-08-07T12:10:18.409970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19804","last_updated":"2023-10-05T20:44:57Z","snapshot_observed_at":"2026-08-08T23:31:25.800827Z","submitted_at":"2023-10-05T20:44:57Z","title":"A Kernel Perspective on Behavioural Metrics for Markov Decision Processes","version":1},"cited_work":{"arxiv_id":"2310.19804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.19804","snapshot_observed_at":"2026-08-07T12:10:09.868581Z","title":"A Kernel Perspective on Behavioural Metrics for Markov Decision Processes","venue":"cs.LG","work_id":"7de35517-96ab-4208-a781-6f2f112afbcf","year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:59.548686Z"},"links":{"cited_paper":"/paper/2310.19804","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:940c695eed5daad250d42efb2963a5d358a10960549cc85fe74992d0a18736b4","observation_id":"bfd2714a-d32b-49e7-9c28-39585c54c841","resolution":{"observed_at":"2026-08-07T12:10:09.934997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:18.079831Z","title":"Learning representations via a robust behavioral metric for deep reinforcement learning","venue":null,"work_id":"d512f97e-c2ac-41e6-aa10-72cb896c7954","year":2022},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:59.652201Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:25f6e4309a2e1e1bf328af05585e569956f0a86d0131fb4f700399b089072346","observation_id":"fc4e8565-3c9c-4dc4-818c-f3b254e2ce68","resolution":{"observed_at":"2026-08-07T12:10:18.177019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:17.857185Z","title":"State chrono representation for enhancing generalization in reinforcement learning","venue":null,"work_id":"0eee7fba-cb0f-4e75-ba2a-1085afb0cdc3","year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:59.778307Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:aaad209cdf80ce89b52ce69c708381b4e0b4fd2214e15c9051f0a2139d6df3a6","observation_id":"5f28d638-bdc7-4b0d-a90f-3d50cb07acc2","resolution":{"observed_at":"2026-08-07T12:10:17.950416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:17.637696Z","title":"Offline reinforcement learning with pseudometric learning","venue":null,"work_id":"40005406-0fbb-44f9-a11b-b32440aaaa3e","year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:59.881247Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:ec526b7ff84ab4abfdef9d7678ee88fa3f0efee03664062577d38f5c4c049895","observation_id":"160a0d47-bb4c-42ed-b586-54d8fcf5d89c","resolution":{"observed_at":"2026-08-07T12:10:17.743648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:17.432720Z","title":"Bisimulation for labelled markov processes","venue":null,"work_id":"17d5747f-fbf3-4bb2-9fa6-4684daa6288d","year":2002},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:59.982921Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:2b65caa50b4f6a340481d85a399e6c5a17913ed0d91697959f6f77a0db531df4","observation_id":"1ed9f1d8-353a-4f1c-ac81-b080d213cbc6","resolution":{"observed_at":"2026-08-07T12:10:17.530504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:17.230772Z","title":"Provably efficient rl with rich observations via latent state decoding","venue":null,"work_id":"5b922f2b-f775-46a5-82b2-a0d372f8fb59","year":2019},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.096030Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:9d3e5bc23418bd9f2d715d22a79cce478ceb881d9c33b83dc6f3926ea0363ffb","observation_id":"af24be27-ebb8-4e44-96da-2f2d6a1d0137","resolution":{"observed_at":"2026-08-07T12:10:17.325024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:00.192754Z","title":"Differential privacy","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.192754Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:7912ef2068c3cc7f7b619aea05700bd9f3418a4dc9ed3dbd407602ca8124058f","observation_id":"2963fefa-d659-4957-a574-5e8ab0b217c5","resolution":{"observed_at":"2026-08-07T12:10:00.192754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08847","last_updated":"2022-03-06T03:45:54Z","snapshot_observed_at":"2026-08-01T16:55:48.527454Z","submitted_at":"2021-10-17T15:21:27Z","title":"Provable RL with Exogenous Distractors via Multistep Inverse Dynamics","version":2},"cited_work":{"arxiv_id":"2110.08847","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.08847","snapshot_observed_at":"2026-08-07T12:10:09.695070Z","title":"Provable RL with Exogenous Distractors via Multistep Inverse Dynamics","venue":"cs.LG","work_id":"000aaded-c0ef-4e38-9d70-68c4a4db0ac1","year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.264076Z"},"links":{"cited_paper":"/paper/2110.08847","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:a9a847490d8e7a4a6a4130b94f359c0f97e018a5a3f2a6f451c212452b64f5c0","observation_id":"e9804ab4-9cc1-4052-93c8-2b9f2fc1691e","resolution":{"observed_at":"2026-08-07T12:10:09.765339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:16.989115Z","title":"Metrics for finite markov decision processes","venue":null,"work_id":"1d70ef9a-a4d1-443b-93b3-d764434af1a0","year":2004},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.324820Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:dad11c3c0c1f7360d99f74feffcac1be4a1bf96c6ce7f3eb87af5cdcc0facf45","observation_id":"c6e73560-ecf9-49a2-ab06-ed543ac55529","resolution":{"observed_at":"2026-08-07T12:10:17.118699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:16.753915Z","title":"Bisimulation metrics for continuous markov decision processes","venue":null,"work_id":"e45ff352-5f8d-4d36-9789-9f495ef3c559","year":2011},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.423106Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:ebf15f3659377edd334369a6e5fe43510a06c17857a971a524f42217f17551a5","observation_id":"a353b52e-0a78-41f2-b7d3-0dc4330feb8e","resolution":{"observed_at":"2026-08-07T12:10:16.873188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:16.548516Z","title":"For sale: State-action representation learning for deep reinforcement learning","venue":null,"work_id":"c747f975-c54e-4138-bcff-6d5b95cb4164","year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.548679Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:8537cb63596602d4c059ba49a73f2c31bf906eb09f52daafd35ff3bd9ef66c14","observation_id":"c0d954e0-386a-4314-8908-e142b08ddef6","resolution":{"observed_at":"2026-08-07T12:10:16.665792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:16.341650Z","title":"Deepmdp: Learning continuous latent space models for representation learning","venue":null,"work_id":"2198435d-be81-4dbc-b1f5-24dd377d81c3","year":2019},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.635009Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:ab1c6cae26a92bed64d856ad21f3bcb683b01d6328ab45b93bbe93f7017a6098","observation_id":"36c45093-8205-432d-a6a0-4303bd0e2635","resolution":{"observed_at":"2026-08-07T12:10:16.432994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:16.158558Z","title":"Fully homomorphic encryption using ideal lattices","venue":null,"work_id":"16638b54-1c5b-49fa-aadc-51716c90ae83","year":2009},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.715862Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:12b37efc8d27857d31eb34175b86dfe079b344d80374e373a9495da37ccec7c0","observation_id":"6aba3156-7c65-41a0-b0ee-ad36b0a4b9c1","resolution":{"observed_at":"2026-08-07T12:10:16.249067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:15.926493Z","title":"Equivalence notions and model minimization in markov decision processes","venue":null,"work_id":"c4263ba2-dd62-43cf-8661-b35aaeda7704","year":2003},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.797333Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:ddd69d56352011033245fa06a6a6878ad04c460dd4aa0e6e3128c9ba36aa10ba","observation_id":"78335d36-026a-483a-9633-db4893764342","resolution":{"observed_at":"2026-08-07T12:10:16.023035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:15.662311Z","title":"Measuring visual generalization in continuous control from pixels, 2020","venue":null,"work_id":"933ea059-de1f-45dd-a507-fe808891b035","year":2020},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.881709Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:7ae53ebba78cd3b2a841d036ce76fd7465c521f8da17ebac2291ef5f8bb352f5","observation_id":"86f75616-1fab-4aab-ab42-47d76a67982c","resolution":{"observed_at":"2026-08-07T12:10:15.823053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:00.960140Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:00.960140Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:5bea2ae244ff02666bffc3c6ee99e876513db6ec7e8e8969de243fa0fb98a69c","observation_id":"133587ba-02ac-454b-92de-9184e9cae30c","resolution":{"observed_at":"2026-08-07T12:10:00.960140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:01.065851Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:01.065851Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:e689be82cccaf353828f54552385205057176bba1cb92c0a712f3965b7171dcf","observation_id":"32926965-1190-44ed-b5a5-933abac577eb","resolution":{"observed_at":"2026-08-07T12:10:01.065851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:15.420313Z","title":"Generalization in reinforcement learning by soft data augmentation","venue":null,"work_id":"b3ad59ef-a346-4d17-9e26-bd89b2a58614","year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:01.184038Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:2f964da908ceec4ec679548d19a1c1830c30ea2a42d7bcf637cc2032472ed05f","observation_id":"97653980-44b6-452e-b514-5b9c3d02ef0d","resolution":{"observed_at":"2026-08-07T12:10:15.521464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-07T12:10:01.292716Z","title":"Td-mpc2: Scalable, robust world models for continuous control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:01.292716Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:506e854be0cc9de3bb3ac3e79b3f6132e53805341e5a3e559f3e61a2186ed265","observation_id":"d30c9ffa-b9a8-48f0-bf99-65f1cc9e1859","resolution":{"observed_at":"2026-08-07T12:10:01.292716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:15.227871Z","title":"Bisimulation makes analogies in goal-conditioned reinforcement learning","venue":null,"work_id":"c90a286a-2e94-447c-9582-33a05567c1c7","year":2022},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:01.470417Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:d310e500f260e608ae1afe52670719b819172bf8aaea87a728211bf8bfe32b5c","observation_id":"401db3f8-06ac-4e22-809c-1fb5192650db","resolution":{"observed_at":"2026-08-07T12:10:15.308971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02034","last_updated":"2022-03-16T13:38:46Z","snapshot_observed_at":"2026-08-08T23:30:41.427380Z","submitted_at":"2021-10-05T13:28:11Z","title":"Dropout Q-Functions for Doubly Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02034","snapshot_observed_at":"2026-08-07T12:10:01.582830Z","title":"Dropout q-functions for doubly efficient reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:01.582830Z"},"links":{"cited_paper":"/paper/2110.02034","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:19dcb86ff6b8029c0c49ca43edfd1bb8e44ae7db934cd938efcbe4721767fcff","observation_id":"9590b081-f6c2-42c2-b002-39d4d4229ea1","resolution":{"observed_at":"2026-08-07T12:10:01.582830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20663","last_updated":"2023-10-31T17:29:46Z","snapshot_observed_at":"2026-08-07T22:51:33.935180Z","submitted_at":"2023-10-31T17:29:46Z","title":"Offline RL with Observation Histories: Analyzing and Improving Sample Complexity","version":1},"cited_work":{"arxiv_id":"2310.20663","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.20663","snapshot_observed_at":"2026-08-07T12:10:09.440181Z","title":"Offline RL with Observation Histories: Analyzing and Improving Sample Complexity","venue":"cs.LG","work_id":"2c9e635c-3071-4df9-8568-bb55a2f609a4","year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:01.802325Z"},"links":{"cited_paper":"/paper/2310.20663","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:d2815e70b3448fbb514d85af20b55f4d432da583021380580d4de41726861b82","observation_id":"5e7b8d07-4517-4bae-a4f8-a34032663cfe","resolution":{"observed_at":"2026-08-07T12:10:09.535229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:15.017900Z","title":"Robust estimation of a location parameter","venue":null,"work_id":"62d956cd-8893-4734-b954-3d6e6cb44f93","year":1992},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:01.956563Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:252bd4df3efdb7dcafe36d1900aa00265e140eec4c61b97e19ab47faaf57a017","observation_id":"b9e03a9b-b85f-4c60-9a63-d11d2b49d2c0","resolution":{"observed_at":"2026-08-07T12:10:15.121679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05996","last_updated":"2024-08-05T11:55:19Z","snapshot_observed_at":"2026-07-06T17:42:03.971883Z","submitted_at":"2024-03-09T19:56:40Z","title":"Dissecting Deep RL with High Update Ratios: Combatting Value Divergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05996","snapshot_observed_at":"2026-08-07T12:10:02.108907Z","title":"Dissecting deep rl with high update ratios: Combatting value divergence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:02.108907Z"},"links":{"cited_paper":"/paper/2403.05996","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:08f08907c3f52e2cf9b2432965d6bbf06aef3ccc212df9cdb77e3fd8b8e96274","observation_id":"69f86b3d-c90e-4df1-a115-c076f20e78ff","resolution":{"observed_at":"2026-08-07T12:10:02.108907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00164","last_updated":"2023-08-14T00:16:23Z","snapshot_observed_at":"2026-08-06T02:43:13.210400Z","submitted_at":"2022-10-31T22:12:48Z","title":"Agent-Controller Representations: Principled Offline RL with Rich Exogenous Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00164","snapshot_observed_at":"2026-08-07T12:10:02.272630Z","title":"Agent-controller representations: Principled offline rl with rich exogenous information","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:02.272630Z"},"links":{"cited_paper":"/paper/2211.00164","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:a94fe0aed466fc983acecbac4419ae00581205c87a6ed6578be75139d9d69449","observation_id":"6a92fa29-fa0a-40b3-9afe-b324da8b8596","resolution":{"observed_at":"2026-08-07T12:10:02.272630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:14.876986Z","title":"Notes on state abstractions, 2018","venue":null,"work_id":"7dba042a-e954-4e1e-b702-39091c989be3","year":2018},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:02.378080Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:d695e343b8c44622aa765e7fe2dfb148d17fdfffc9c9860821ba439a358ae64c","observation_id":"4a5fd4cf-f48b-4944-97ae-96187a520c25","resolution":{"observed_at":"2026-08-07T12:10:14.927607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T12:10:02.500205Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:02.500205Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:740383b425631f67b3cf75fa6bca889b04cdb8b0c4083ed0e524703ba1258aed","observation_id":"41f3f372-d33e-492c-884e-7fb7725a1911","resolution":{"observed_at":"2026-08-07T12:10:02.500205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:14.709293Z","title":"Towards robust bisimulation metric learning","venue":null,"work_id":"33eeb14b-9311-495d-9180-8fdf0a33d232","year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:02.620055Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:dee16db00b0f2255adf14c812a51a901ca9d47da61ae870d59981acd334029ae","observation_id":"775c2685-2da6-4591-9c80-0e17ef943d0c","resolution":{"observed_at":"2026-08-07T12:10:14.772844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:02.701330Z","title":"Actor-critic algorithms","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:02.701330Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:6b2a4750502206fe49f0920cd72b38cbcea90323f5ffc36325ed99ec0638449b","observation_id":"e54fcacf-ade9-48b2-86c1-e823d1dd9d15","resolution":{"observed_at":"2026-08-07T12:10:02.701330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:14.562547Z","title":"On the necessity of abstraction","venue":null,"work_id":"fc272bd1-81dd-4ec0-9032-f0f12d1932c2","year":2019},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:02.807491Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:85eb93db8899e09b4eba93192f72f6575077a44466800371cd2d98427585969c","observation_id":"411d86a9-8572-41fd-ae03-3ea0008967ed","resolution":{"observed_at":"2026-08-07T12:10:14.633089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:14.447337Z","title":"Towards a unified theory of state abstraction for mdps","venue":null,"work_id":"709a3013-f4aa-414d-a563-12b622f6bdc4","year":2006},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:02.901775Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:509a5e3822e5a3b4205918706e13ebfb85d780529447f2298b498f835d512d8b","observation_id":"b28ae5d3-817d-4871-8aa2-e3586711a174","resolution":{"observed_at":"2026-08-07T12:10:14.497410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00656","last_updated":"2023-06-01T13:24:56Z","snapshot_observed_at":"2026-08-06T16:21:01.501297Z","submitted_at":"2023-06-01T13:24:56Z","title":"Normalization Enhances Generalization in Visual Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00656","snapshot_observed_at":"2026-08-07T12:10:03.069253Z","title":"Normalization enhances generalization in visual reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:03.069253Z"},"links":{"cited_paper":"/paper/2306.00656","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:2025078e182f4da6355782ac2dc54d3fdd235eeda0272fe4b142a7b57da97ab6","observation_id":"2f008026-a793-43c8-8cc6-de98b8a454bd","resolution":{"observed_at":"2026-08-07T12:10:03.069253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:14.317943Z","title":"Does self-supervised learning really improve reinforcement learning from pixels? Advances in Neural Information Processing Systems, 35: 0 30865--30881, 2022","venue":null,"work_id":"6aa372e7-3e6b-4b96-ac63-c5bb92600ed1","year":2022},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:03.185882Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:5bc70f59025be327bdb8070b4f98c841112fd2dd1ff1ed4b94c88464f96516e8","observation_id":"115ec923-15e0-4ac2-939b-fa8505fcac96","resolution":{"observed_at":"2026-08-07T12:10:14.403204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:14.159539Z","title":"Policy-independent behavioral metric-based representation for deep reinforcement learning","venue":null,"work_id":"eba7eb34-17f2-4bff-bf95-c363cb281568","year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:03.335536Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:cd5359e183a33b06d479fecafd46fa27da387bf95767e9a930cdf064b6e1f5e8","observation_id":"72e401eb-9734-402d-ba76-e8d8684832be","resolution":{"observed_at":"2026-08-07T12:10:14.212925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.977938Z","title":"Robust representation learning by clustering with bisimulation metrics for visual reinforcement learning with distractions","venue":null,"work_id":"4be1a0ad-ad53-4c0e-8e5b-39aaba5ea64a","year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:03.488758Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:d71bf0cc3d728d48136146fa1be09fe27f9740634ee60b5aead0085c9b313c7a","observation_id":"267e61b1-7c37-48b5-838e-01ae14620537","resolution":{"observed_at":"2026-08-07T12:10:14.066667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.771106Z","title":"A calculus of communicating systems","venue":null,"work_id":"5be7e591-73ad-4795-8f5d-e4b2b2d3d3a0","year":1980},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:03.623907Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:e13120a4246e1053d40b4a71d83a49ff985f5a824adb997172dd9fb3c2201197","observation_id":"f5dd29b7-3fd7-4adc-9231-5630e1c5563c","resolution":{"observed_at":"2026-08-07T12:10:13.862971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17098","last_updated":"2025-03-10T07:33:32Z","snapshot_observed_at":"2026-07-06T18:36:26.223825Z","submitted_at":"2024-06-24T19:36:45Z","title":"Learning Temporal Distances: Contrastive Successor Features Can Provide a Metric Structure for Decision-Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17098","snapshot_observed_at":"2026-08-07T12:10:03.799665Z","title":"Learning temporal distances: Contrastive successor features can provide a metric structure for decision-making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:03.799665Z"},"links":{"cited_paper":"/paper/2406.17098","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:851e6eec30901a4fcf3790e11db18e0513f1224ed4eb5288b8b47c0bc835277a","observation_id":"65f2fd91-e0f9-4f6c-acc1-bbddd58b6956","resolution":{"observed_at":"2026-08-07T12:10:03.799665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-07T12:10:03.917362Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:03.917362Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:35d31bed090fdc0db28891a1997047807f4926528704bf65c55ef468f022da06","observation_id":"8fd96c6b-db8e-4849-a3f8-57a82ec57793","resolution":{"observed_at":"2026-08-07T12:10:03.917362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08898","last_updated":"2024-04-21T05:59:37Z","snapshot_observed_at":"2026-08-07T07:35:05.900443Z","submitted_at":"2024-01-17T00:47:43Z","title":"Bridging State and History Representations: Understanding Self-Predictive RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08898","snapshot_observed_at":"2026-08-07T12:10:04.252390Z","title":"Bridging state and history representations: Understanding self-predictive rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:04.252390Z"},"links":{"cited_paper":"/paper/2401.08898","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:27ebd6ff2000e7320d1632dcb4393fb8de6e01c8fd49fdaa85715e06c8dcbca7","observation_id":"c7d1b2e4-9bf3-443a-8c6e-ece296354c84","resolution":{"observed_at":"2026-08-07T12:10:04.252390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.597959Z","title":"Control-oriented model-based reinforcement learning with implicit differentiation","venue":null,"work_id":"00e5f65d-00be-49ac-ac2c-0d50e2932691","year":2022},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:04.606982Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:be0c68589344d9d1f45e08e32003af428e7b14e63477a9dc74c11d3b8bfd58ca","observation_id":"931028da-d570-487c-9abd-9ba7b96635b7","resolution":{"observed_at":"2026-08-07T12:10:13.688357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.371992Z","title":"Labelled Markov Processes","venue":null,"work_id":"fa2d7ac9-e9eb-476b-b28c-1b4e906a5c54","year":2009},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:05.193640Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:03786cc12d1e70441e14563a437a237e548dae083952e1300917bca405166c3c","observation_id":"54cb92e7-247e-4cd7-92c0-07564015d10b","resolution":{"observed_at":"2026-08-07T12:10:13.476146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.213428Z","title":"Policy gradient methods in the presence of symmetries and state abstractions","venue":null,"work_id":"c1d0fa5b-d92f-4709-ab47-9aea711c4284","year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:06.399252Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:02b0660d1b205e1320395704b12e423b0a794c3ed122eb0f9b46d4e6b0de5877","observation_id":"fcedacdf-7d37-48e7-90da-33688ff09bd1","resolution":{"observed_at":"2026-08-07T12:10:13.298662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.055124Z","title":"Concurrency and automata on infinite sequences","venue":null,"work_id":"70ad0c62-4bea-416e-8a71-ac437349f46e","year":1981},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:06.461937Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:cb5252f82f4c36329db2e3bcc0878f7310aace366a6c6948832f18cd3a119c75","observation_id":"a2831909-7709-4ddd-81ba-8b1f2cc6dca0","resolution":{"observed_at":"2026-08-07T12:10:13.122998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.841664Z","title":"State-action similarity-based representations for off-policy evaluation","venue":null,"work_id":"c658fbb4-fe1b-4aff-9610-4f4c152ad074","year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:06.534084Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:33010d7837abfd951fdd556f70c943055b4d3c6ebe0959fad0a6c38518861c16","observation_id":"25533d6b-be35-4a66-9adc-84251b81fdbb","resolution":{"observed_at":"2026-08-07T12:10:12.931278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.601407Z","title":"An algebraic approach to abstraction in reinforcement learning","venue":null,"work_id":"979d959d-dc51-44c5-954b-50b2f2e748e0","year":2004},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:06.595261Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:4f10fa6ca827238dc1477cd439f33c869bcddfdf42f8f7ddb6579a95ae9e8295","observation_id":"e443b986-897a-4bff-8345-e822fcbbd9cc","resolution":{"observed_at":"2026-08-07T12:10:12.706810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.456559Z","title":"Model minimization in hierarchical reinforcement learning","venue":null,"work_id":"adbafa8d-f37d-4d1c-aabf-fa8464d3a96c","year":2002},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:06.695657Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:7db72cfba2d9c017b2c957120bc539c2621042334c7eb89369ca5733921ae068","observation_id":"e20b064e-c1c4-4cf3-97e9-984df4c0f430","resolution":{"observed_at":"2026-08-07T12:10:12.514760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.318215Z","title":"Continuous mdp homomorphisms and homomorphic policy gradient","venue":null,"work_id":"a7a59c49-0a37-41cd-a774-26764bdd5ce3","year":2022},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:06.791035Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:caadc4cc5f6babcc0bbfae92d79aac4396cdbde72cdafa290f00bb4431f35f47","observation_id":"fb3364eb-b99b-4fe9-bf9e-ef2453325940","resolution":{"observed_at":"2026-08-07T12:10:12.371374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16369","last_updated":"2024-06-24T13:19:17Z","snapshot_observed_at":"2026-08-09T10:19:36.778962Z","submitted_at":"2024-03-25T02:17:54Z","title":"Learning Action-based Representations Using Invariance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16369","snapshot_observed_at":"2026-08-07T12:10:06.863385Z","title":"Learning action-based representations using invariance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:06.863385Z"},"links":{"cited_paper":"/paper/2403.16369","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:8da1c572ef8a16dd7baafb83299aaeede64e4dac9aa52cd328254a2c4c7452aa","observation_id":"5d1e18c3-e85b-4599-8fcf-5576952ec28c","resolution":{"observed_at":"2026-08-07T12:10:06.863385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.117340Z","title":"Facenet: A unified embedding for face recognition and clustering","venue":null,"work_id":"b367dfb3-91e1-4dfd-8f0b-7ef45ed3f4b9","year":2015},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:06.946603Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:08083f331b28fe77c4ec3f2ea4dc0d59048a98e83e15d617a380cf81d04ce99f","observation_id":"0b58ff51-e8f0-48eb-b82f-6a086d098ca2","resolution":{"observed_at":"2026-08-07T12:10:12.215444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05929","last_updated":"2021-05-20T09:15:57Z","snapshot_observed_at":"2026-08-08T02:14:18.940330Z","submitted_at":"2020-07-12T07:38:15Z","title":"Data-Efficient Reinforcement Learning with Self-Predictive Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05929","snapshot_observed_at":"2026-08-07T12:10:07.046569Z","title":"Data-efficient reinforcement learning with self-predictive representations","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.046569Z"},"links":{"cited_paper":"/paper/2007.05929","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:7f890eb106bea5cf9919755e401288e1e6c6caa320ebb12ba0de8abc74af2fec","observation_id":"aacff5eb-c4b3-4ba5-ac6d-3b9a6edfe064","resolution":{"observed_at":"2026-08-07T12:10:07.046569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04553","last_updated":"2024-10-06T17:12:10Z","snapshot_observed_at":"2026-08-09T10:33:49.625646Z","submitted_at":"2024-10-06T17:12:10Z","title":"Bisimulation metric for Model Predictive Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04553","snapshot_observed_at":"2026-08-07T12:10:07.161039Z","title":"Bisimulation metric for model predictive control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.161039Z"},"links":{"cited_paper":"/paper/2410.04553","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:62a777ae4359e45be0943eff44f7f89efed56de2a905110758143d5bbed5fd8f","observation_id":"5fd4873b-5137-480a-9f76-3412cba45740","resolution":{"observed_at":"2026-08-07T12:10:07.161039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.943667Z","title":"Reinforcement learning with soft state aggregation","venue":null,"work_id":"6d971e10-293a-4cd2-a062-a3129ce86728","year":1994},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.288340Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:9426590b54f8bbf36d9443164991817e959e46af9a1e838d7458aed1d51e4d43","observation_id":"ffeb9102-a325-48c2-8769-e5630f47905e","resolution":{"observed_at":"2026-08-07T12:10:12.002559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07860","last_updated":"2022-08-16T17:37:36Z","snapshot_observed_at":"2026-08-07T07:51:14.255787Z","submitted_at":"2022-08-16T17:37:36Z","title":"A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07860","snapshot_observed_at":"2026-08-07T12:10:07.379760Z","title":"A walk in the park: Learning to walk in 20 minutes with model-free reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.379760Z"},"links":{"cited_paper":"/paper/2208.07860","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:0a413e93ab0cc1831a0332bb342b8c4e5cfd2f85fbc1c82f3cab3f1fd7970302","observation_id":"9049565e-2b4a-44b2-8be0-bc466da837ba","resolution":{"observed_at":"2026-08-07T12:10:07.379760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.02722","last_updated":"2021-01-07T19:03:34Z","snapshot_observed_at":"2026-08-06T20:03:52.435962Z","submitted_at":"2021-01-07T19:03:34Z","title":"The Distracting Control Suite -- A Challenging Benchmark for Reinforcement Learning from Pixels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.02722","snapshot_observed_at":"2026-08-07T12:10:07.468224Z","title":"The distracting control suite--a challenging benchmark for reinforcement learning from pixels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.468224Z"},"links":{"cited_paper":"/paper/2101.02722","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:03ad37da35185353bd379af120f127ceda9987a1bd107a308de6b2d089a18c0c","observation_id":"bbe7f5bf-f3f4-4e6c-ac12-f37294582b35","resolution":{"observed_at":"2026-08-07T12:10:07.468224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.769388Z","title":"Approximate information state for approximate planning and reinforcement learning in partially observed systems","venue":null,"work_id":"77ec3a0c-255a-47bc-bb0d-8281d524da86","year":2022},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.537316Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:0b64e73da89a6a651b233165c6559005e7bd30e1abedf9953fc73c054dc3d207","observation_id":"5d38d754-8f0d-4bd0-9436-f6c5b17ea498","resolution":{"observed_at":"2026-08-07T12:10:11.853121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:10:07.623587Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.623587Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:4f8bdc5ae63c21b0c3976b94e714a21e890ecbfcfe737bb3a7a0882e429f659a","observation_id":"2bdfd756-83ac-44a5-aafa-613e25fea1e5","resolution":{"observed_at":"2026-08-07T12:10:07.623587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.549996Z","title":"Lax probabilistic bisimulation","venue":null,"work_id":"341a8cfd-f0a4-470c-ad66-00798eaac591","year":2008},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.691352Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:0431b068bce463dc107f4688f7243add31f8ee89d3793f789c03ea4dd65c6faa","observation_id":"5cadb823-c646-48a9-968e-b1a8aae70913","resolution":{"observed_at":"2026-08-07T12:10:11.635694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07775","last_updated":"2021-11-15T14:16:28Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-15T14:16:28Z","title":"Learning Representations for Pixel-based Control: What Matters and Why?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07775","snapshot_observed_at":"2026-08-07T12:10:07.756955Z","title":"Learning representations for pixel-based control: What matters and why? arXiv preprint arXiv:2111.07775, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.756955Z"},"links":{"cited_paper":"/paper/2111.07775","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:d360a6d66217549a0ab1813fbadd99a53658f3beffb9b79858ed79b2649969a3","observation_id":"6d4f6ab7-e5e1-416c-b58c-f381b4871e22","resolution":{"observed_at":"2026-08-07T12:10:07.756955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.869845Z","title":"dm\\_control: Software and tasks for continuous control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.869845Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:e65e9e506bb32f1999b7ca1894649ffc19f03f1fbc9f696552eb1b6a7f065215","observation_id":"d2ad554f-ef64-4e00-94e9-dd55c99069ee","resolution":{"observed_at":"2026-08-07T12:10:07.869845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11963","last_updated":"2020-02-27T08:29:10Z","snapshot_observed_at":"2026-08-08T06:19:38.136041Z","submitted_at":"2020-02-27T08:29:10Z","title":"Plannable Approximations to MDP Homomorphisms: Equivariance under Actions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11963","snapshot_observed_at":"2026-08-07T12:10:07.966060Z","title":"Plannable approximations to mdp homomorphisms: Equivariance under actions","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.966060Z"},"links":{"cited_paper":"/paper/2002.11963","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:3ccc94d6f6796d5f05239623ce96be0887f5582770ca4bf01289b9aa5c5560dc","observation_id":"a1863e4a-5ea5-45cd-935c-f9893becef74","resolution":{"observed_at":"2026-08-07T12:10:07.966060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.342579Z","title":"Mdp homomorphic networks: Group symmetries in reinforcement learning","venue":null,"work_id":"a81ded2c-5d0a-40b7-b38b-dc2f9bf15e45","year":2020},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.037509Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:a09a79e656b55fb5131be3130633701e36568ff7d76843a5d2250d729b05381f","observation_id":"25028b49-4390-48a3-8642-48798d115c7c","resolution":{"observed_at":"2026-08-07T12:10:11.402431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17718","last_updated":"2024-06-25T17:06:57Z","snapshot_observed_at":"2026-08-06T13:08:38.190693Z","submitted_at":"2024-06-25T17:06:57Z","title":"When does Self-Prediction help? Understanding Auxiliary Tasks in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17718","snapshot_observed_at":"2026-08-07T12:10:08.108971Z","title":"When does self-prediction help? understanding auxiliary tasks in reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.108971Z"},"links":{"cited_paper":"/paper/2406.17718","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:6c0094129f80f171a81fd5fbb3679a949742606a635e6f55d30b6addbaf2738b","observation_id":"76f8c420-993f-4d08-8869-c3e699ab28ca","resolution":{"observed_at":"2026-08-07T12:10:08.108971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.154624Z","title":"Efficient potential-based exploration in reinforcement learning using inverse dynamic bisimulation metric","venue":null,"work_id":"60b0c902-a179-45c3-85d6-4f66bb022e26","year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.176373Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:7534724e904af25a8e0b56150a0703820a91ac441aef2cf3515291caed209318","observation_id":"977ac222-ea26-496e-a7a7-baedeaf9a543","resolution":{"observed_at":"2026-08-07T12:10:11.238699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.974133Z","title":"Rethinking exploration in reinforcement learning with effective metric-based exploration bonus","venue":null,"work_id":"55c596fb-4b0d-4628-ad0b-0bae1bdacb25","year":2024},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.271332Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:09a8c0756ac67c531d998e5b9e780c041a40f9c58a1433d1eea398457845223d","observation_id":"e90c7c54-1f0e-42be-b1c1-c6d223bff424","resolution":{"observed_at":"2026-08-07T12:10:11.048518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09645","last_updated":"2021-07-20T17:29:13Z","snapshot_observed_at":"2026-07-06T11:30:56.150751Z","submitted_at":"2021-07-20T17:29:13Z","title":"Mastering Visual Continuous Control: Improved Data-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09645","snapshot_observed_at":"2026-08-07T12:10:08.362608Z","title":"Mastering visual continuous control: Improved data-augmented reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.362608Z"},"links":{"cited_paper":"/paper/2107.09645","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:8cdea324791d35442f4654329e20b8aaa329d7553841f93d779eeb63914b616d","observation_id":"9c9c5dd5-7582-4680-9f1a-78961d4f25b2","resolution":{"observed_at":"2026-08-07T12:10:08.362608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.823829Z","title":"Improving sample efficiency in model-free reinforcement learning from images","venue":null,"work_id":"0167adf2-3b0b-4be8-a400-e978ab2b9904","year":2021},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.455921Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:acc973fe9430101a9f4dbd7c50b5d01060cbd8b7258cb71ad8e13a2dc4b448ec","observation_id":"b681e948-fb94-4a12-8579-4c9251b77a80","resolution":{"observed_at":"2026-08-07T12:10:10.905731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.643480Z","title":"Rl-vigen: A reinforcement learning benchmark for visual generalization","venue":null,"work_id":"7a2fbd80-1ea6-443a-b5db-949f42dabb67","year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.524623Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:fc790b02dd42cf7d46c305e3afab6d38205fef8ec7af1d1b09daea4fef0b9c15","observation_id":"ca9e0fd8-5706-4d22-929f-61b9a4722915","resolution":{"observed_at":"2026-08-07T12:10:10.732423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.412882Z","title":"Simsr: Simple distance-based state representations for deep reinforcement learning","venue":null,"work_id":"5e1167e1-810e-41e1-9cee-9a2926fd3aa3","year":2022},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.606269Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:82f6af12c8a8d673543df99d79f8f6c07328e70de6834ac20e1713ba3252e97e","observation_id":"88f09758-2d04-4bc8-91c3-0a9c7bbb457c","resolution":{"observed_at":"2026-08-07T12:10:10.516198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.156888Z","title":"Understanding and addressing the pitfalls of bisimulation-based representations in offline reinforcement learning","venue":null,"work_id":"004ec0ff-55f8-4541-b215-5e971329c321","year":2023},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.728222Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:0561d98864c54dad4f0af3baf88ceb2fa8eafebc47700e3e3767ea27cda15c9b","observation_id":"336e1ed6-9e01-4c97-991c-7509e3e44bf2","resolution":{"observed_at":"2026-08-07T12:10:10.296954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06032","last_updated":"2018-11-14T19:50:54Z","snapshot_observed_at":"2026-07-06T07:14:46.708144Z","submitted_at":"2018-11-14T19:50:54Z","title":"Natural Environment Benchmarks for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.06032","snapshot_observed_at":"2026-08-07T12:10:08.787938Z","title":"Natural environment benchmarks for reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.787938Z"},"links":{"cited_paper":"/paper/1811.06032","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:d05dad2199b295debf5009580fa6e31826d524a7c3e1f1ab528b1edabff3248b","observation_id":"1b9d6aa3-31f5-480a-8477-4de65d0ab96f","resolution":{"observed_at":"2026-08-07T12:10:08.787938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10742","last_updated":"2021-04-07T01:57:14Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:59:35Z","title":"Learning Invariant Representations for Reinforcement Learning without Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10742","snapshot_observed_at":"2026-08-07T12:10:08.875246Z","title":"Learning invariant representations for reinforcement learning without reconstruction","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.875246Z"},"links":{"cited_paper":"/paper/2006.10742","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:a7851fe1b68cb2443504ba42368bf7c79ca590b8f4b97bbe509ce7fd872c50fe","observation_id":"c31911ca-51a1-4fe3-9d1f-3e4581e9afdb","resolution":{"observed_at":"2026-08-07T12:10:08.875246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.987854Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:08.987854Z"},"links":{"citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:f0ac4a4112ac712b94c8f355bfcfb030ad63c902d6f81c6c716cfe725bf889b6","observation_id":"4ac23cb1-3a23-4855-8ef0-985cb1ad2783","resolution":{"observed_at":"2026-08-07T12:10:08.987854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T23:31:22.389018Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":3,"verified_fuzzy":44},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 1 inbound Pith citation observation for arXiv:2506.00563."}